VoxCPM2 · TTS für 30 Sprachen · Voice Cloning

VoxCPM — Tokenizer-freies mehrsprachiges Voice-Cloning-TTS

OpenBMBs VoxCPM2-Modell, eingebettet aus dem offiziellen Hugging-Face-Space

Teste VoxCPM online für mehrsprachiges Text-to-Speech, Voice Design, kontrollierbares Voice Cloning und 48-kHz-KI-Stimmen. Diese Seite fasst öffentliche VoxCPM2-Fakten unabhängig und suchmaschinenfreundlich zusammen.

2B Parameter30 SprachenVoice DesignKontrollierbares Klonen48-kHz-AusgabeApache-2.0
VoxCPM2 · offizieller Hugging-Face-Space
In Hugging Face öffnen

Dies ist der offizielle VoxCPM-Demo-Space auf Hugging Face von OpenBMB. Der erste Lauf kann länger dauern, während die gehostete Demo startet. Gib keine vertraulichen Texte oder privaten Stimmproben in einen öffentlichen Space ein.

Kurz erklärt

Was ist VoxCPM?

VoxCPM ist eine offene Text-to-Speech-Modellfamilie von OpenBMB. Die aktuelle Version VoxCPM2 konzentriert sich auf natürliche mehrsprachige Sprache, kreatives Voice Design und realitätsnahes Voice Cloning ohne eine Pipeline mit diskreten Sprach-Token.

Laut öffentlicher Modellkarte und Dokumentation ist VoxCPM2 ein 2B-Parameter-Modell für tokenizer-freies, diffusion-autoregressives TTS. Es wurde mit mehr als 2 Millionen Stunden mehrsprachiger Sprache trainiert, unterstützt 30 Sprachen, nutzt kurze Referenzaudios für Cloning und erzeugt 48-kHz-Audio über AudioVAE V2.

Der eingebettete Space eignet sich für schnelle Tests: mehrsprachiges TTS, Voice Design per natürlicher Beschreibung, kontrollierbares Klonen mit Stilhinweisen und hochwertigeres Klonen mit Referenzaudio plus Transkript.

Funktionen

Warum VoxCPM2 auffällt

VoxCPM verbindet mehrsprachige Generierung, Voice Design, Cloning und produktionsnahe Bereitstellung in einem offenen Modell-Workflow.

Tokenizer-freies diffusion-autoregressives TTS

VoxCPM2 erzeugt kontinuierliche Sprachrepräsentationen direkt über eine diffusion-autoregressive Architektur statt über diskrete Sprach-Token.

Mehrsprachige Sprache in 30 Sprachen

Die Modellkarte nennt 30 unterstützte Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Spanisch, Französisch, Deutsch, Portugiesisch, Hindi, Arabisch und Vietnamesisch.

Voice Design per natürlicher Sprache

Beschreibe eine Stimme mit Attributen wie Geschlecht, Alter, Ton, Emotion oder Tempo, um ohne Referenzaudio eine neue synthetische Stimme zu erzeugen.

Kontrollierbares und hochwertiges Voice Cloning

Lade einen kurzen Referenzclip hoch, erhalte die Stimmfarbe, steuere den Ausdruck mit Stilhinweisen oder nutze ein Transkript für höherwertiges Cloning.

48-kHz-Ausgabe und Streaming-Pfad

VoxCPM2 akzeptiert 16-kHz-Referenzaudio und erzeugt 48-kHz-Sprache; die Dokumentation beschreibt Echtzeit-Streaming und schnellere Nano-vLLM-Bereitstellung.

Offene und sicherheitsbewusste Veröffentlichung

Die Veröffentlichung ist Apache-2.0, verbietet aber ausdrücklich Imitation, Betrug und Desinformation. Kennzeichne KI-generierte Audiodateien klar.

Anleitung

VoxCPM in vier Schritten testen

Der gehostete Space zeigt die wichtigsten VoxCPM2-Workflows ohne lokale Installation.

1

VoxCPM-Space öffnen

Nutze den eingebetteten Hugging-Face-Space oder öffne ihn in einem neuen Tab. Kaltstarts können dauern, während Abhängigkeiten und Modell laden.

2

Text in einer unterstützten Sprache eingeben

Füge ein kurzes Skript ein. VoxCPM2 ist für mehrsprachige Eingaben ohne separates Sprach-Tag ausgelegt.

3

Voice Design oder Cloning wählen

Für Voice Design beschreibst du die Sprecherstimme. Für Cloning lädst du einen sauberen Referenzclip hoch und nutzt Stilhinweise nur bei Bedarf.

4

Generierung abstimmen und anhören

Passe Schritte, Guidance, Denoise- oder Stiloptionen an, generiere ein kurzes Sample und iteriere auf Aussprache, Tempo und Stil.

Modelldetails

VoxCPM-Fähigkeiten auf einen Blick

Wichtige öffentliche Fakten aus Modellkarte, Space-Metadaten, Dokumentation und Demo-Seite — hier für die schnelle Bewertung neu formuliert.

Modellfamilie
VoxCPM / VoxCPM2 von OpenBMB
Hauptaufgabe
Mehrsprachiges Text-to-Speech, Voice Design, kontrollierbares Voice Cloning und High-Fidelity-Cloning
Architektur
Tokenizer-freie diffusion-autoregressive TTS-Pipeline, beschrieben als LocEnc → TSLM → RALM → LocDiT
Größe und Backbone
2B Parameter, aufgebaut auf einem MiniCPM-4-Backbone
Trainingsumfang
Mehr als 2 Millionen Stunden mehrsprachiger Sprachdaten laut öffentlicher Modellkarte
Sprachabdeckung
30 Sprachen plus aufgeführte chinesische Dialekte wie Sichuanesisch, Kantonesisch, Wu und nordöstliches Mandarin
Audioqualität
Akzeptiert 16-kHz-Referenzaudio und erzeugt 48-kHz-Sprache über AudioVAE V2
Gehostete Demo
Offizieller Gradio-Space openbmb/VoxCPM-Demo, aktuell unter openbmb-voxcpm-demo.hf.space
Lizenz
Apache-2.0 laut VoxCPM2-Modell- und Space-Metadaten
Anwendungsfälle

Was du mit VoxCPM bauen kannst

VoxCPM passt besonders zu Voice-Projekten, die Mehrsprachigkeit, steuerbaren Ausdruck und Self-Hosting benötigen.

Mehrsprachige Produktnarration

Erstelle Entwürfe für Produktführungen, Lektionen und Erklärvideos in vielen Sprachen, bevor finale Sprecheraufnahmen entstehen.

Voice-Agent-Prototyping

Teste Personas, Sprechtempo, Emotion und 48-kHz-Qualität, bevor du einen produktiven Voice-Agent-Stack anschließt.

Dubbing- und Lokalisierungstests

Bewerte Aussprache, Rhythmus und Ausdruck für lokalisierte Skripte in Sprachen, die ältere TTS-Systeme oft schwach abdecken.

Zustimmungsbasiertes Voice Cloning

Klone nur Stimmen mit Erlaubnis und nutze Stilsteuerung, um Emotion oder Tempo zu variieren, ohne die Stimmfarbe zu verlieren.

Synthetische Charakterstimmen

Nutze Voice Design für neue fiktive oder markensichere Stimmen, ohne eine reale Person zu klonen.

Entwicklerbewertung

Vergleiche VoxCPM mit anderen offenen TTS-Systemen, teste das Python-Paket oder untersuche Nano-vLLM für geringere Latenz.

Best Practices

Tipps für bessere VoxCPM-Ergebnisse

  • Beginne mit kurzem Text, um Aussprache, Rhythmus und Stimmkonsistenz schnell zu bewerten.
  • Nutze sauberes Referenzaudio mit nur einer Sprecherperson; Rauschen oder mehrere Stimmen erschweren die Ähnlichkeit.
  • Wenn Voice Design das Ziel verfehlt, formuliere konkrete Attribute wie Alter, Tempo, Emotion und Stimmtextur.
  • Für High-Fidelity-Cloning hilft ein passendes Transkript, weil der Kontext die ursprüngliche Darbietung besser erhält.
  • Verwende in öffentlichen Spaces keine vertraulichen Skripte oder privaten Stimmproben; hoste VoxCPM2 für sensible Arbeit selbst.
  • Nutze VoxCPM nicht für Imitation, Betrug oder unmarkierte synthetische Medien. Hole vor jedem Klonen Zustimmung ein.
FAQ

Häufige Fragen zu VoxCPM

Kurze Antworten zu VoxCPM für mehrsprachiges TTS, Voice Cloning, Voice Design und selbst gehostete KI-Stimmen.

Was ist VoxCPM?

VoxCPM ist OpenBMBs tokenizer-freie Text-to-Speech-Modellfamilie. VoxCPM2 ist die aktuelle 2B-Parameter-Version für mehrsprachige Sprachgenerierung, Voice Design und Voice Cloning.

Kann ich VoxCPM online testen?

Ja. Diese Seite bettet den offiziellen VoxCPM-Demo-Space von Hugging Face ein, sodass du VoxCPM2 im Browser testen kannst, ohne zuerst das Python-Paket zu installieren.

Welche Sprachen unterstützt VoxCPM2?

Die öffentliche Modellkarte nennt 30 Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Spanisch, Französisch, Deutsch, Portugiesisch, Hindi, Arabisch und Vietnamesisch sowie mehrere chinesische Dialekte.

Unterstützt VoxCPM Voice Cloning?

Ja. VoxCPM2 unterstützt kontrollierbares Voice Cloning mit Referenzaudio und ein hochwertiges Cloning-Verfahren mit Referenzclip plus Transkript. Klone nur Stimmen, für die du Rechte oder Zustimmung hast.

Was bedeutet VoxCPM Voice Design?

Voice Design lässt dich eine gewünschte Stimme in natürlicher Sprache beschreiben — etwa Alter, Geschlecht, Ton, Emotion oder Tempo — und ohne Aufnahme eine neue synthetische Stimme erzeugen.

Ist die eingebettete VoxCPM-Demo privat?

Nein. Die eingebettete App ist ein öffentlicher Hugging-Face-Space außerhalb von Whisper AI. Für vertrauliche Texte oder private Stimmen solltest du das Modell selbst hosten.

Teste VoxCPM im Browser

Erzeuge mehrsprachige Sprache, teste Voice Design und bewerte zustimmungsbasiertes Cloning in der offiziellen Hugging-Face-Demo.