VoxCPM2 · 30-talige TTS · stemklonen

VoxCPM — Tokenizer-vrij meertalig stemklonen TTS

OpenBMB's VoxCPM2-model, ingebed vanuit de officiële Hugging Face Space

Probeer VoxCPM online voor meertalige tekst-naar-spraak, stemontwerp, bestuurbaar stemklonen en 48 kHz AI-spraak. Deze pagina herschrijft openbare VoxCPM2-feiten in een onafhankelijke, doorzoekbare gids met de officiële demo hieronder ingesloten.

2B-parameters30 talenStemontwerpControleerbaar klonen48 kHz-uitvoerApache-2.0
VoxCPM2 · officiële Hugging Face-ruimte
Openen in Hugging Face

Dit is de officiële VoxCPM-demoruimte die wordt gehost op Hugging Face door OpenBMB. De eerste run kan langzamer zijn terwijl de gehoste demo ontwaakt. Vermijd vertrouwelijke tekst of privéstemvoorbeelden in een openbare ruimte.

Snel antwoord

Wat is VoxCPM?

VoxCPM is een open tekst-naar-spraak-modelfamilie van OpenBMB. De huidige VoxCPM2-release richt zich op natuurlijke meertalige spraak, creatief stemontwerp en levensecht stemklonen, terwijl een discrete spraak-tokenizer-pijplijn wordt vermeden.

Volgens de openbare VoxCPM2-modelkaart en projectdocumentatie is VoxCPM2 een 2B-parameter-tokenizer-vrij diffusie-autoregressief TTS-model dat is getraind op meer dan 2 miljoen uur meertalige spraak. Het ondersteunt 30 talen, accepteert korte referentieaudio voor klonen en voert 48 kHz-spraak uit via AudioVAE V2.

De ingebedde Space is handig voor een snelle evaluatie, omdat deze de workflows blootlegt die teams daadwerkelijk als eerste testen: directe meertalige TTS, stemontwerp in natuurlijke taal, regelbaar klonen met stijlbegeleiding en klonen met hogere betrouwbaarheid met referentieaudio plus transcript.

Kenmerken

Waarom VoxCPM2 opvalt

VoxCPM combineert meertalige generatie, stemontwerp, klonen en productiegerichte bediening in één open modelworkflow.

Tokenizer-vrije diffusie autoregressieve TTS

VoxCPM2 genereert rechtstreeks continue spraakrepresentaties via een autoregressieve diffusiearchitectuur in plaats van te vertrouwen op discrete spraaktokens.

Meertalige spraak in 30 talen

De modelkaart vermeldt 30 ondersteunde talen, waaronder Chinees, Engels, Japans, Koreaans, Spaans, Frans, Duits, Portugees, Hindi, Arabisch, Vietnamees en meer.

Stemontwerp vanuit natuurlijke taal

Beschrijf een spreker met kenmerken zoals geslacht, leeftijd, toon, emotie of tempo, en laat VoxCPM2 vervolgens een nieuwe synthetische stem creëren zonder referentieaudio.

Controleerbaar en ultiem stemklonen

Upload een korte referentieclip om de klankkleur te behouden, voeg stijlbegeleiding toe om de expressie te sturen of zorg voor een transcriptie voor klonen met hogere betrouwbaarheid.

48 kHz-uitvoer en streamingpad

VoxCPM2 accepteert 16 kHz referentieaudio en voert 48 kHz-spraak uit; de documenten rapporteren realtime streaming met standaard gevolgtrekking en snellere Nano-vLLM-service.

Open en veiligheidsbewuste release

De publieke release is Apache-2.0, maar het project verbiedt expliciet nabootsing van identiteit, fraude en desinformatie. Label door AI gegenereerde audio duidelijk.

Hoe te gebruiken

Probeer VoxCPM in vier stappen

De gehoste Space biedt u de belangrijkste VoxCPM2-workflows zonder lokale installatie.

1

Open de VoxCPM-ruimte

Gebruik de ingesloten Hugging Face-ruimte hierboven of open deze in een nieuw tabblad. Een koude start kan extra tijd in beslag nemen terwijl de gehoste omgeving de afhankelijkheden en het model laadt.

2

Voer tekst in een ondersteunde taal in

Plak uw script rechtstreeks. VoxCPM2 is ontworpen voor meertalige invoer zonder aparte taaltag, dus begin met een korte zin in uw doeltaal.

3

Kies stemontwerp of klonen

Voor stemontwerp plaatst u een sprekerbeschrijving in natuurlijke taal vóór de tekst. Voor klonen uploadt u een schone referentieclip en voegt u alleen stijlbegeleiding toe als u het tempo of de emotie wilt veranderen.

4

Stem generatie af en luister

Pas inferentiestappen, begeleiding, ruisonderdrukking of stijlinstellingen in de demo aan, genereer een korte sample en herhaal dit totdat de uitspraak, het tempo en de sprekerstijl goed zijn.

Modeldetails

VoxCPM-mogelijkheden in één oogopslag

Belangrijke openbare feiten uit de VoxCPM2 Hugging Face-modelkaart, Space-metagegevens, documentatie en projectdemopagina, herschreven voor snelle evaluatie.

Modelfamilie
VoxCPM / VoxCPM2 van OpenBMB
Primaire taak
Meertalige tekst-naar-spraak, stemontwerp, regelbaar stemklonen en hifi-klonen
Architectuur
Tokenizervrije diffusie autoregressieve TTS-pijplijn beschreven als LocEnc → TSLM → RALM → LocDiT
Grootte en ruggengraat
2B-parameters, gebouwd op een MiniCPM-4-backbone
Opleidingsschaal
Meer dan 2 miljoen uur aan meertalige spraakgegevens volgens de openbare modelkaart
Taaldekking
30 talen plus ondersteuning voor Chinese dialecten, waaronder Sichuanese, Kantonees, Wu, Noordoost-Mandarijn en andere
Audiokwaliteit
Accepteert 16 kHz referentieaudio en voert 48 kHz-spraak uit via AudioVAE V2
Gehoste demo
Officiële Gradio Space op openbmb/VoxCPM-Demo, momenteel bediend vanuit openbmb-voxcpm-demo.hf.space
Licentie
Apache-2.0 volgens het VoxCPM2-model en Space-metagegevens
Gebruiksgevallen

Wat u kunt bouwen met VoxCPM

VoxCPM is het nuttigst wanneer een spraakproject meertalige breedte, regelbare expressie en de mogelijkheid tot zelfhosting nodig heeft.

Meertalige productvertelling

Maak concept-voice-overs voor productrondleidingen, lessen en uitleggers in vele talen voordat u de definitieve menselijke vertelling opneemt.

Prototyping van stemagenten

Ontdek stempersonages, snelheid, emotionele toon en 48 kHz-uitvoerkwaliteit voordat u een productiestemagentstack aansluit.

Nasynchronisatie- en lokalisatietests

Evalueer uitspraak, ritme en expressiviteit voor gelokaliseerde scripts in talen die vaak niet worden ondersteund door oudere TTS-systemen.

Op toestemming gebaseerd stemklonen

Kloon een luidspreker alleen als je daarvoor toestemming hebt, en gebruik vervolgens bestuurbare begeleiding om verschillende emoties of tempo's te testen, terwijl de klankkleur behouden blijft.

Synthetische karakterverkenning

Gebruik stemontwerp wanneer u een nieuwe fictieve of merkveilige stem nodig heeft zonder een echte persoon te klonen.

Evaluatie van ontwikkelaars

Vergelijk de VoxCPM met andere open TTS-systemen, test het Python-pakket of bestudeer het Nano-vLLM-serveerpad voor experimenten met een lagere latentie.

Beste praktijken

Tips voor betere VoxCPM-resultaten

  • Begin met korte tekst, zodat u de uitspraak, het ritme en de stemconsistentie snel kunt beoordelen voordat u lange passages genereert.
  • Gebruik zuivere referentieaudio met één luidspreker voor het klonen; luidruchtige clips of meerdere luidsprekers maken het moeilijker om de gelijkenis van de luidsprekers te beoordelen.
  • Als een ontworpen stem het doel mist, herschrijf dan de sprekerbeschrijving met concrete kenmerken zoals leeftijd, tempo, emotie en stemtextuur.
  • Voor hifi-klonen geeft u het referentietranscript op wanneer de demo daarom vraagt, omdat de op transcriptie uitgelijnde context helpt de oorspronkelijke levering te behouden.
  • Vermijd vertrouwelijke scripts of privéstemvoorbeelden in een openbaar gehoste ruimte; self-host VoxCPM2 voor gevoelig productiewerk.
  • Gebruik VoxCPM niet voor nabootsing van identiteit, fraude of ongelabelde synthetische media. Vraag toestemming voordat u een echte stem gaat klonen.
Veelgestelde vragen

VoxCPM veelgestelde vragen

Korte antwoorden voor mensen die de VoxCPM evalueren voor meertalige TTS, stemklonen, stemontwerp en zelfgehoste AI-stemworkflows.

Wat is VoxCPM?

VoxCPM is de tokenizer-vrije tekst-naar-spraak-modelfamilie van OpenBMB. VoxCPM2 is de huidige 2B-parameterrelease voor meertalige spraakgeneratie, stemontwerp en stemklonen.

Kan ik VoxCPM online proberen?

Ja. Deze pagina bevat de officiële VoxCPM-demo Hugging Face Space, zodat u VoxCPM2 in de browser kunt testen zonder eerst het Python-pakket te installeren.

Welke talen ondersteunt VoxCPM2?

De openbare VoxCPM2-modelkaart bevat 30 talen, waaronder Chinees, Engels, Japans, Koreaans, Spaans, Frans, Duits, Portugees, Hindi, Arabisch, Vietnamees en andere, plus verschillende Chinese dialecten.

Ondersteunt VoxCPM stemklonen?

Ja. VoxCPM2 ondersteunt regelbaar stemklonen van referentieaudio en een geavanceerde kloonworkflow die zowel de referentieclip als het transcript ervan kan gebruiken voor een hogere betrouwbaarheid. Kloon alleen stemmen waarvan u de eigenaar bent of waarvoor u toestemming hebt om deze te gebruiken.

Wat is VoxCPM-stemontwerp?

Met stemontwerp kunt u een gewenste spreker in natuurlijke taal beschrijven (bijvoorbeeld leeftijd, geslacht, toon, emotie of tempo) en spraak genereren met die nieuw ontworpen stem zonder een referentie-opname te uploaden.

Is de ingebedde VoxCPM-demo privé?

Nee. De ingebouwde app is een openbare Hugging Face Space die buiten Whisper AI wordt uitgevoerd. Dien daar geen vertrouwelijke tekst of privéstemvoorbeelden in; host zelf het model voor gevoelig werk.

Probeer VoxCPM in uw browser

Genereer meertalige spraak, test stemontwerp en evalueer op toestemming gebaseerd klonen in de officiële Hugging Face-demo voordat u VoxCPM lokaal installeert.