VoxCPM2 · TTS in 30 lingue · clonazione vocale

VoxCPM — TTS multilingue senza tokenizer con clonazione vocale

Il modello VoxCPM2 di OpenBMB, incorporato dallo Space Hugging Face ufficiale

Prova VoxCPM online per text-to-speech multilingue, voice design, clonazione vocale controllabile e voce IA a 48 kHz. Questa pagina rielabora i fatti pubblici di VoxCPM2 in una guida indipendente e indicizzabile.

2B parametri30 lingueVoice designClonazione controllabileOutput 48 kHzApache-2.0
VoxCPM2 · Space Hugging Face ufficiale
Apri in Hugging Face

Questo è lo Space ufficiale VoxCPM-Demo ospitato su Hugging Face da OpenBMB. Il primo avvio può essere più lento mentre la demo ospitata si attiva. Evita testi riservati o campioni vocali privati in uno Space pubblico.

Risposta rapida

Che cos'è VoxCPM?

VoxCPM è una famiglia aperta di modelli text-to-speech di OpenBMB. L'attuale VoxCPM2 punta a parlato multilingue naturale, voice design creativo e clonazione vocale realistica, senza una pipeline basata su token vocali discreti.

Secondo model card e documentazione pubbliche, VoxCPM2 è un modello TTS diffusion autoregressivo senza tokenizer da 2B parametri, addestrato su oltre 2 milioni di ore di parlato multilingue. Supporta 30 lingue, accetta brevi audio di riferimento e produce parlato a 48 kHz tramite AudioVAE V2.

Lo Space incorporato è utile per una valutazione rapida: TTS multilingue diretto, voice design in linguaggio naturale, clonazione controllabile con indicazioni di stile e clonazione più fedele con audio di riferimento e trascrizione.

Funzionalità

Perché VoxCPM2 si distingue

VoxCPM unisce generazione multilingue, voice design, clonazione e serving orientato alla produzione in un workflow di modello aperto.

TTS diffusion autoregressivo senza tokenizer

VoxCPM2 genera direttamente rappresentazioni continue del parlato con un'architettura diffusion autoregressiva, invece di usare token vocali discreti.

Parlato multilingue in 30 lingue

La model card elenca 30 lingue supportate, tra cui cinese, inglese, giapponese, coreano, spagnolo, francese, tedesco, portoghese, hindi, arabo e vietnamita.

Voice design in linguaggio naturale

Descrivi una voce con genere, età, tono, emozione o ritmo e lascia che VoxCPM2 crei una voce sintetica senza audio di riferimento.

Clonazione controllabile e ad alta fedeltà

Carica un breve clip per preservare il timbro, aggiungi indicazioni di stile o fornisci una trascrizione per una clonazione più fedele.

Output a 48 kHz e percorso streaming

VoxCPM2 accetta audio di riferimento a 16 kHz e genera parlato a 48 kHz; la documentazione riporta streaming real-time e serving Nano-vLLM più veloce.

Rilascio aperto e attento alla sicurezza

Il rilascio è Apache-2.0, ma il progetto vieta impersonificazione, frodi e disinformazione. Etichetta chiaramente l'audio generato da IA.

Come usarlo

Prova VoxCPM in quattro passaggi

Lo Space ospitato offre i principali workflow VoxCPM2 senza configurazione locale.

1

Apri lo Space VoxCPM

Usa lo Space Hugging Face incorporato o aprilo in una nuova scheda. I cold start possono richiedere tempo mentre ambiente e modello si caricano.

2

Inserisci testo in una lingua supportata

Incolla uno script breve. VoxCPM2 è progettato per input multilingue senza tag lingua separato.

3

Scegli voice design o clonazione

Per il voice design descrivi il parlante. Per la clonazione carica un clip pulito e usa indicazioni di stile per cambiare ritmo o emozione.

4

Regola e ascolta

Modifica passi di inferenza, guidance, denoise o stile, genera un breve sample e itera su pronuncia, ritmo e personalità.

Dettagli del modello

Capacità di VoxCPM in sintesi

Fatti pubblici da model card, metadati dello Space, documentazione e pagina demo, rielaborati per una valutazione veloce.

Famiglia del modello
VoxCPM / VoxCPM2 di OpenBMB
Attività principale
Text-to-speech multilingue, voice design, clonazione controllabile e clonazione ad alta fedeltà
Architettura
Pipeline TTS diffusion autoregressiva senza tokenizer descritta come LocEnc → TSLM → RALM → LocDiT
Dimensione e backbone
2B parametri, costruito su backbone MiniCPM-4
Scala di training
Oltre 2 milioni di ore di dati vocali multilingue secondo la model card pubblica
Copertura linguistica
30 lingue e dialetti cinesi elencati, tra cui sichuanese, cantonese, wu e mandarino nord-orientale
Qualità audio
Accetta audio di riferimento a 16 kHz e produce parlato a 48 kHz tramite AudioVAE V2
Demo ospitata
Space Gradio ufficiale openbmb/VoxCPM-Demo, attualmente servito da openbmb-voxcpm-demo.hf.space
Licenza
Apache-2.0 secondo i metadati del modello VoxCPM2 e dello Space
Casi d'uso

Cosa puoi creare con VoxCPM

VoxCPM è utile quando un progetto vocale richiede copertura multilingue, espressione controllabile e opzione di self-hosting.

Narrazione prodotto multilingue

Crea bozze di voiceover per tour, lezioni e video esplicativi in più lingue prima della registrazione umana finale.

Prototipi di agenti vocali

Esplora persona, velocità, emozione e qualità a 48 kHz prima di collegare uno stack voice-agent in produzione.

Test di doppiaggio e localizzazione

Valuta pronuncia, ritmo ed espressività per script localizzati in lingue spesso meno servite dai vecchi TTS.

Clonazione vocale con consenso

Clona una voce solo con permesso e usa il controllo di stile per testare emozioni o ritmo preservando il timbro.

Voci sintetiche per personaggi

Usa il voice design quando ti serve una voce fittizia o sicura per il brand senza clonare una persona reale.

Valutazione sviluppatori

Confronta VoxCPM con altri TTS aperti, testa il pacchetto Python o studia Nano-vLLM per ridurre la latenza.

Best practice

Consigli per risultati migliori con VoxCPM

  • Inizia con testo breve per valutare rapidamente pronuncia, ritmo e coerenza della voce.
  • Usa audio di riferimento pulito con un solo parlante; rumore o più voci riducono la somiglianza.
  • Se il voice design non centra l'obiettivo, riscrivi la descrizione con età, ritmo, emozione e texture vocale concrete.
  • Per clonazione ad alta fedeltà, fornisci la trascrizione di riferimento quando richiesta dalla demo.
  • Evita script riservati o campioni vocali privati in Spaces pubblici; auto-ospita VoxCPM2 per lavoro sensibile.
  • Non usare VoxCPM per impersonificazione, frode o media sintetici non etichettati. Ottieni consenso prima di clonare una voce reale.
FAQ

Domande frequenti su VoxCPM

Risposte brevi per valutare VoxCPM in TTS multilingue, clonazione vocale, voice design e workflow auto-ospitati.

Che cos'è VoxCPM?

VoxCPM è la famiglia text-to-speech senza tokenizer di OpenBMB. VoxCPM2 è la versione attuale da 2B parametri per parlato multilingue, voice design e clonazione vocale.

Posso provare VoxCPM online?

Sì. Questa pagina incorpora lo Space ufficiale VoxCPM-Demo di Hugging Face, così puoi testare VoxCPM2 nel browser senza installare prima il pacchetto Python.

Quali lingue supporta VoxCPM2?

La model card pubblica elenca 30 lingue, tra cui cinese, inglese, giapponese, coreano, spagnolo, francese, tedesco, portoghese, hindi, arabo, vietnamita e diversi dialetti cinesi.

VoxCPM supporta la clonazione vocale?

Sì. VoxCPM2 supporta clonazione controllabile da audio di riferimento e un workflow più fedele con clip e trascrizione. Clona solo voci autorizzate.

Cos'è il voice design di VoxCPM?

Il voice design permette di descrivere una voce in linguaggio naturale — età, genere, tono, emozione o ritmo — e generare una voce nuova senza registrazione di riferimento.

La demo incorporata di VoxCPM è privata?

No. L'app incorporata è uno Space Hugging Face pubblico esterno a Whisper AI. Per testi o voci sensibili, auto-ospita il modello.

Prova VoxCPM nel browser

Genera parlato multilingue, testa il voice design e valuta la clonazione con consenso nella demo ufficiale Hugging Face.