VoxCPM2 · TTS en 30 idiomas · clonación de voz

VoxCPM — TTS multilingüe sin tokenizer con clonación de voz

El modelo VoxCPM2 de OpenBMB, integrado desde el Space oficial de Hugging Face

Prueba VoxCPM online para texto a voz multilingüe, diseño de voz, clonación controlable y voz IA de 48 kHz. Esta página reescribe los datos públicos de VoxCPM2 como una guía independiente e indexable.

2B parámetros30 idiomasDiseño de vozClonación controlableSalida 48 kHzApache-2.0
VoxCPM2 · Space oficial de Hugging Face
Abrir en Hugging Face

Este es el Space oficial VoxCPM-Demo alojado en Hugging Face por OpenBMB. La primera ejecución puede ser más lenta mientras la demo hospedada despierta. Evita textos confidenciales o muestras de voz privadas en un Space público.

Respuesta rápida

¿Qué es VoxCPM?

VoxCPM es una familia abierta de modelos de texto a voz de OpenBMB. La versión actual VoxCPM2 se centra en habla multilingüe natural, diseño creativo de voz y clonación realista sin una cadena basada en tokens discretos de habla.

Según la model card y la documentación públicas, VoxCPM2 es un modelo TTS diffusion autoregresivo sin tokenizer de 2B parámetros, entrenado con más de 2 millones de horas de habla multilingüe. Soporta 30 idiomas, acepta audio corto de referencia y genera voz de 48 kHz con AudioVAE V2.

El Space integrado sirve para evaluar rápido: TTS multilingüe directo, diseño de voz con lenguaje natural, clonación controlable con guía de estilo y clonación de mayor fidelidad con audio de referencia y transcripción.

Funciones

Por qué destaca VoxCPM2

VoxCPM combina generación multilingüe, diseño de voz, clonación y serving orientado a producción en un flujo de modelo abierto.

TTS diffusion autoregresivo sin tokenizer

VoxCPM2 genera directamente representaciones continuas de habla con una arquitectura diffusion autoregresiva en lugar de depender de tokens discretos de voz.

Habla multilingüe en 30 idiomas

La model card enumera 30 idiomas, incluidos chino, inglés, japonés, coreano, español, francés, alemán, portugués, hindi, árabe, vietnamita y más.

Diseño de voz con lenguaje natural

Describe una voz con género, edad, tono, emoción o ritmo y deja que VoxCPM2 cree una voz sintética sin audio de referencia.

Clonación controlable y de alta fidelidad

Sube un clip corto para preservar el timbre, añade guía de estilo o proporciona una transcripción para clonación de continuación más fiel.

Salida 48 kHz y ruta de streaming

VoxCPM2 acepta audio de referencia de 16 kHz y genera voz de 48 kHz; la documentación informa streaming en tiempo real y serving más rápido con Nano-vLLM.

Lanzamiento abierto y consciente de la seguridad

La publicación es Apache-2.0, pero el proyecto prohíbe suplantación, fraude y desinformación. Etiqueta claramente el audio generado por IA.

Cómo usarlo

Prueba VoxCPM en cuatro pasos

El Space hospedado ofrece los flujos clave de VoxCPM2 sin instalación local.

1

Abre el Space de VoxCPM

Usa el Space de Hugging Face integrado o ábrelo en una pestaña nueva. Los cold starts pueden tardar mientras cargan dependencias y modelo.

2

Escribe texto en un idioma soportado

Pega un guion corto. VoxCPM2 está diseñado para entrada multilingüe sin etiqueta de idioma separada.

3

Elige diseño de voz o clonación

Para diseño de voz, describe el hablante. Para clonación, sube un clip limpio y añade guía de estilo si quieres cambiar ritmo o emoción.

4

Ajusta y escucha

Modifica pasos de inferencia, guidance, denoise o estilo, genera una muestra corta e itera sobre pronunciación, ritmo y personalidad.

Detalles del modelo

Capacidades de VoxCPM de un vistazo

Datos públicos de la model card, metadatos del Space, documentación y página de demo, reescritos para evaluación rápida.

Familia de modelo
VoxCPM / VoxCPM2 de OpenBMB
Tarea principal
Texto a voz multilingüe, diseño de voz, clonación controlable y clonación de alta fidelidad
Arquitectura
Pipeline TTS diffusion autoregresiva sin tokenizer descrita como LocEnc → TSLM → RALM → LocDiT
Tamaño y backbone
2B parámetros, construido sobre un backbone MiniCPM-4
Escala de entrenamiento
Más de 2 millones de horas de datos de habla multilingüe según la model card pública
Cobertura de idiomas
30 idiomas y dialectos chinos listados, incluidos sichuanés, cantonés, wu y mandarín del nordeste
Calidad de audio
Acepta audio de referencia de 16 kHz y genera voz de 48 kHz mediante AudioVAE V2
Demo hospedada
Space Gradio oficial openbmb/VoxCPM-Demo, servido actualmente desde openbmb-voxcpm-demo.hf.space
Licencia
Apache-2.0 según metadatos del modelo VoxCPM2 y del Space
Casos de uso

Qué puedes crear con VoxCPM

VoxCPM es útil cuando un proyecto de voz necesita alcance multilingüe, expresión controlable y opción de autoalojamiento.

Narración de producto multilingüe

Crea borradores de locución para tours, lecciones y explicadores en varios idiomas antes de grabar narración humana final.

Prototipos de agentes de voz

Explora personas, velocidad, emoción y calidad 48 kHz antes de conectar una pila de agente de voz en producción.

Pruebas de doblaje y localización

Evalúa pronunciación, ritmo y expresividad de guiones localizados en idiomas a menudo poco cubiertos por TTS antiguos.

Clonación de voz con consentimiento

Clona una voz solo con permiso y usa guía controlable para probar emociones o ritmo preservando el timbre.

Voces de personajes sintéticos

Usa diseño de voz cuando necesites una voz ficticia o segura para marca sin clonar a una persona real.

Evaluación para desarrolladores

Compara VoxCPM con otros sistemas TTS abiertos, prueba el paquete Python o estudia Nano-vLLM para menor latencia.

Buenas prácticas

Consejos para mejores resultados con VoxCPM

  • Empieza con texto corto para evaluar pronunciación, ritmo y consistencia de voz rápidamente.
  • Usa audio de referencia limpio y de una sola persona; ruido o múltiples voces dificultan la similitud.
  • Si el diseño de voz no acierta, reescribe la descripción con edad, ritmo, emoción y textura vocal concretos.
  • Para clonación de alta fidelidad, proporciona la transcripción de referencia cuando la demo la solicite.
  • Evita guiones confidenciales o voces privadas en Spaces públicos; autoaloja VoxCPM2 para trabajo sensible.
  • No uses VoxCPM para suplantación, fraude o medios sintéticos sin etiquetar. Obtén consentimiento antes de clonar cualquier voz real.
FAQ

Preguntas frecuentes sobre VoxCPM

Respuestas cortas para evaluar VoxCPM en TTS multilingüe, clonación de voz, diseño de voz y flujos autoalojados.

¿Qué es VoxCPM?

VoxCPM es la familia de texto a voz sin tokenizer de OpenBMB. VoxCPM2 es la versión actual de 2B parámetros para habla multilingüe, diseño de voz y clonación vocal.

¿Puedo probar VoxCPM online?

Sí. Esta página integra el Space oficial VoxCPM-Demo de Hugging Face para probar VoxCPM2 en el navegador sin instalar primero el paquete Python.

¿Qué idiomas soporta VoxCPM2?

La model card pública lista 30 idiomas, incluidos chino, inglés, japonés, coreano, español, francés, alemán, portugués, hindi, árabe, vietnamita y varios dialectos chinos.

¿VoxCPM soporta clonación de voz?

Sí. VoxCPM2 soporta clonación controlable desde audio de referencia y un flujo de mayor fidelidad con clip y transcripción. Clona solo voces con permiso.

¿Qué es el diseño de voz en VoxCPM?

El diseño de voz permite describir una voz en lenguaje natural — edad, género, tono, emoción o ritmo — y generar una voz nueva sin grabación de referencia.

¿La demo integrada de VoxCPM es privada?

No. La app integrada es un Space público de Hugging Face fuera de Whisper AI. Para textos o voces sensibles, autoaloja el modelo.

Prueba VoxCPM en tu navegador

Genera voz multilingüe, prueba diseño de voz y evalúa clonación con consentimiento en la demo oficial de Hugging Face.