VoxCPM2 · TTS 30 langues · clonage vocal

VoxCPM — TTS multilingue sans tokenizer avec clonage vocal

Le modèle VoxCPM2 d'OpenBMB, intégré depuis le Space Hugging Face officiel

Testez VoxCPM en ligne pour la synthèse vocale multilingue, le voice design, le clonage vocal contrôlable et la parole IA en 48 kHz. Cette page reformule les informations publiques de VoxCPM2 dans un guide indépendant et indexable.

2B paramètres30 languesVoice designClonage contrôlableSortie 48 kHzApache-2.0
VoxCPM2 · Space Hugging Face officiel
Ouvrir dans Hugging Face

Voici le Space officiel VoxCPM-Demo hébergé sur Hugging Face par OpenBMB. Le premier lancement peut être plus lent pendant le réveil de la démo hébergée. N'envoyez pas de texte confidentiel ni d'échantillon vocal privé dans un Space public.

Réponse rapide

Qu'est-ce que VoxCPM ?

VoxCPM est une famille ouverte de modèles Text-to-Speech créée par OpenBMB. La version actuelle VoxCPM2 vise une parole multilingue naturelle, le voice design créatif et un clonage vocal réaliste, sans passer par une chaîne de tokens vocaux discrets.

D'après la model card et la documentation publiques, VoxCPM2 est un modèle TTS diffusion autoregressif sans tokenizer de 2B paramètres. Il a été entraîné sur plus de 2 millions d'heures de parole multilingue, prend en charge 30 langues, accepte de courts audios de référence et produit une sortie 48 kHz via AudioVAE V2.

Le Space intégré est pratique pour une évaluation rapide : TTS multilingue direct, voice design en langage naturel, clonage contrôlable avec indications de style et clonage plus fidèle avec audio de référence et transcription.

Fonctionnalités

Pourquoi VoxCPM2 se distingue

VoxCPM réunit génération multilingue, voice design, clonage et déploiement orienté production dans un workflow de modèle ouvert.

TTS diffusion autoregressif sans tokenizer

VoxCPM2 génère directement des représentations vocales continues avec une architecture diffusion autoregressive, au lieu de s'appuyer sur des tokens vocaux discrets.

Parole multilingue en 30 langues

La model card liste 30 langues, dont chinois, anglais, japonais, coréen, espagnol, français, allemand, portugais, hindi, arabe, vietnamien et d'autres.

Voice design en langage naturel

Décrivez une voix avec le genre, l'âge, le ton, l'émotion ou le rythme, puis laissez VoxCPM2 créer une nouvelle voix synthétique sans audio de référence.

Clonage vocal contrôlable et haute fidélité

Chargez un court clip pour préserver le timbre, ajoutez des consignes de style ou fournissez une transcription pour un clonage de type continuation plus fidèle.

Sortie 48 kHz et chemin de streaming

VoxCPM2 accepte un audio de référence 16 kHz et produit une parole 48 kHz ; la documentation mentionne le streaming temps réel et une accélération Nano-vLLM.

Publication ouverte et attentive à la sécurité

La publication est sous Apache-2.0, mais le projet interdit l'usurpation d'identité, la fraude et la désinformation. Signalez clairement l'audio généré par IA.

Mode d'emploi

Tester VoxCPM en quatre étapes

Le Space hébergé expose les principaux workflows VoxCPM2 sans installation locale.

1

Ouvrir le Space VoxCPM

Utilisez le Space Hugging Face intégré ou ouvrez-le dans un nouvel onglet. Un démarrage à froid peut prendre du temps pendant le chargement du modèle.

2

Entrer un texte dans une langue prise en charge

Collez un court script. VoxCPM2 est conçu pour l'entrée multilingue sans étiquette de langue séparée.

3

Choisir voice design ou clonage

Pour le voice design, décrivez la voix. Pour le clonage, chargez un clip propre et ajoutez des indications de style si vous voulez modifier le rythme ou l'émotion.

4

Régler la génération et écouter

Ajustez les étapes d'inférence, la guidance, le débruitage ou le style, générez un court extrait puis itérez sur la prononciation et le rythme.

Détails du modèle

Les capacités de VoxCPM en un coup d'œil

Faits publics issus de la model card, des métadonnées du Space, de la documentation et de la page de démo, reformulés pour une évaluation rapide.

Famille de modèles
VoxCPM / VoxCPM2 par OpenBMB
Tâche principale
Text-to-Speech multilingue, voice design, clonage vocal contrôlable et clonage haute fidélité
Architecture
Pipeline TTS diffusion autoregressif sans tokenizer, décrit comme LocEnc → TSLM → RALM → LocDiT
Taille et backbone
2B paramètres, construit sur un backbone MiniCPM-4
Échelle d'entraînement
Plus de 2 millions d'heures de parole multilingue selon la model card publique
Couverture linguistique
30 langues et plusieurs dialectes chinois listés, dont sichuanais, cantonais, wu et mandarin du Nord-Est
Qualité audio
Accepte un audio de référence 16 kHz et produit une parole 48 kHz via AudioVAE V2
Démo hébergée
Space Gradio officiel openbmb/VoxCPM-Demo, actuellement servi depuis openbmb-voxcpm-demo.hf.space
Licence
Apache-2.0 selon les métadonnées du modèle VoxCPM2 et du Space
Cas d'usage

Ce que vous pouvez créer avec VoxCPM

VoxCPM est utile lorsqu'un projet vocal demande une large couverture linguistique, une expression contrôlable et la possibilité d'auto-héberger.

Narration produit multilingue

Créez des voix de brouillon pour visites produit, cours et vidéos explicatives dans plusieurs langues avant l'enregistrement final.

Prototypage d'agents vocaux

Explorez personas, vitesse, émotion et qualité 48 kHz avant de connecter une pile d'agent vocal en production.

Tests de doublage et localisation

Évaluez la prononciation, le rythme et l'expressivité de scripts localisés dans des langues parfois peu couvertes par les anciens TTS.

Clonage vocal avec consentement

Clonez une voix uniquement avec autorisation, puis utilisez la guidance pour tester des émotions ou rythmes différents.

Voix de personnages synthétiques

Utilisez le voice design pour créer une voix fictive ou sûre pour une marque sans cloner une personne réelle.

Évaluation développeur

Comparez VoxCPM à d'autres TTS ouverts, testez le package Python ou étudiez le chemin Nano-vLLM pour réduire la latence.

Bonnes pratiques

Conseils pour de meilleurs résultats VoxCPM

  • Commencez avec un texte court pour juger vite la prononciation, le rythme et la cohérence vocale.
  • Utilisez un audio de référence propre avec une seule personne ; bruit et voix multiples réduisent la similarité.
  • Si le voice design manque la cible, reformulez avec des attributs concrets : âge, rythme, émotion, texture vocale.
  • Pour un clonage haute fidélité, fournissez la transcription de référence lorsqu'elle est demandée.
  • N'envoyez pas de scripts confidentiels ni de voix privées dans un Space public ; auto-hébergez VoxCPM2 pour les usages sensibles.
  • N'utilisez pas VoxCPM pour l'usurpation, la fraude ou les médias synthétiques non signalés. Obtenez le consentement avant tout clonage réel.
FAQ

Questions fréquentes sur VoxCPM

Réponses courtes pour évaluer VoxCPM en TTS multilingue, clonage vocal, voice design et workflows auto-hébergés.

Qu'est-ce que VoxCPM ?

VoxCPM est la famille Text-to-Speech sans tokenizer d'OpenBMB. VoxCPM2 est la version actuelle de 2B paramètres pour parole multilingue, voice design et clonage vocal.

Puis-je essayer VoxCPM en ligne ?

Oui. Cette page intègre le Space Hugging Face officiel VoxCPM-Demo, pour tester VoxCPM2 dans le navigateur sans installer le package Python.

Quelles langues VoxCPM2 prend-il en charge ?

La model card publique liste 30 langues, dont chinois, anglais, japonais, coréen, espagnol, français, allemand, portugais, hindi, arabe, vietnamien, ainsi que plusieurs dialectes chinois.

VoxCPM prend-il en charge le clonage vocal ?

Oui. VoxCPM2 permet le clonage contrôlable depuis un audio de référence et un workflow plus fidèle avec audio plus transcription. Ne clonez que des voix autorisées.

Qu'est-ce que le voice design VoxCPM ?

Le voice design permet de décrire une voix en langage naturel — âge, genre, ton, émotion ou rythme — et de générer une nouvelle voix sans enregistrement de référence.

La démo intégrée de VoxCPM est-elle privée ?

Non. L'application intégrée est un Space Hugging Face public extérieur à Whisper AI. Auto-hébergez le modèle pour les textes ou voix sensibles.

Essayez VoxCPM dans votre navigateur

Générez de la parole multilingue, testez le voice design et évaluez le clonage avec consentement dans la démo Hugging Face officielle.