Perché ne parliamo
Una voce sintetica che non parte da token discreti.
VoxCPM genera rappresentazioni vocali continue con un’architettura diffusion autoregressiva. VoxCPM2 unisce lingue, voice design, cloning e audio a 48kHz in un modello utilizzabile via Python e serving compatibile.
Cosa trovi dentro
- Modello VoxCPM2 da 2B parametri in 30 lingue.
- Voice design da una descrizione testuale.
- Cloning controllabile e ultimate cloning da audio di riferimento.
- Output a 48kHz e streaming real-time con opzioni vLLM.