VoxCPM — TTS multilingüe sin tokenizer con clonación de voz
El modelo VoxCPM2 de OpenBMB, integrado desde el Space oficial de Hugging Face
Prueba VoxCPM online para texto a voz multilingüe, diseño de voz, clonación controlable y voz IA de 48 kHz. Esta página reescribe los datos públicos de VoxCPM2 como una guía independiente e indexable.
Este es el Space oficial VoxCPM-Demo alojado en Hugging Face por OpenBMB. La primera ejecución puede ser más lenta mientras la demo hospedada despierta. Evita textos confidenciales o muestras de voz privadas en un Space público.
¿Qué es VoxCPM?
VoxCPM es una familia abierta de modelos de texto a voz de OpenBMB. La versión actual VoxCPM2 se centra en habla multilingüe natural, diseño creativo de voz y clonación realista sin una cadena basada en tokens discretos de habla.
Según la model card y la documentación públicas, VoxCPM2 es un modelo TTS diffusion autoregresivo sin tokenizer de 2B parámetros, entrenado con más de 2 millones de horas de habla multilingüe. Soporta 30 idiomas, acepta audio corto de referencia y genera voz de 48 kHz con AudioVAE V2.
El Space integrado sirve para evaluar rápido: TTS multilingüe directo, diseño de voz con lenguaje natural, clonación controlable con guía de estilo y clonación de mayor fidelidad con audio de referencia y transcripción.
Por qué destaca VoxCPM2
VoxCPM combina generación multilingüe, diseño de voz, clonación y serving orientado a producción en un flujo de modelo abierto.
TTS diffusion autoregresivo sin tokenizer
VoxCPM2 genera directamente representaciones continuas de habla con una arquitectura diffusion autoregresiva en lugar de depender de tokens discretos de voz.
Habla multilingüe en 30 idiomas
La model card enumera 30 idiomas, incluidos chino, inglés, japonés, coreano, español, francés, alemán, portugués, hindi, árabe, vietnamita y más.
Diseño de voz con lenguaje natural
Describe una voz con género, edad, tono, emoción o ritmo y deja que VoxCPM2 cree una voz sintética sin audio de referencia.
Clonación controlable y de alta fidelidad
Sube un clip corto para preservar el timbre, añade guía de estilo o proporciona una transcripción para clonación de continuación más fiel.
Salida 48 kHz y ruta de streaming
VoxCPM2 acepta audio de referencia de 16 kHz y genera voz de 48 kHz; la documentación informa streaming en tiempo real y serving más rápido con Nano-vLLM.
Lanzamiento abierto y consciente de la seguridad
La publicación es Apache-2.0, pero el proyecto prohíbe suplantación, fraude y desinformación. Etiqueta claramente el audio generado por IA.
Prueba VoxCPM en cuatro pasos
El Space hospedado ofrece los flujos clave de VoxCPM2 sin instalación local.
Abre el Space de VoxCPM
Usa el Space de Hugging Face integrado o ábrelo en una pestaña nueva. Los cold starts pueden tardar mientras cargan dependencias y modelo.
Escribe texto en un idioma soportado
Pega un guion corto. VoxCPM2 está diseñado para entrada multilingüe sin etiqueta de idioma separada.
Elige diseño de voz o clonación
Para diseño de voz, describe el hablante. Para clonación, sube un clip limpio y añade guía de estilo si quieres cambiar ritmo o emoción.
Ajusta y escucha
Modifica pasos de inferencia, guidance, denoise o estilo, genera una muestra corta e itera sobre pronunciación, ritmo y personalidad.
Capacidades de VoxCPM de un vistazo
Datos públicos de la model card, metadatos del Space, documentación y página de demo, reescritos para evaluación rápida.
Qué puedes crear con VoxCPM
VoxCPM es útil cuando un proyecto de voz necesita alcance multilingüe, expresión controlable y opción de autoalojamiento.
Narración de producto multilingüe
Crea borradores de locución para tours, lecciones y explicadores en varios idiomas antes de grabar narración humana final.
Prototipos de agentes de voz
Explora personas, velocidad, emoción y calidad 48 kHz antes de conectar una pila de agente de voz en producción.
Pruebas de doblaje y localización
Evalúa pronunciación, ritmo y expresividad de guiones localizados en idiomas a menudo poco cubiertos por TTS antiguos.
Clonación de voz con consentimiento
Clona una voz solo con permiso y usa guía controlable para probar emociones o ritmo preservando el timbre.
Voces de personajes sintéticos
Usa diseño de voz cuando necesites una voz ficticia o segura para marca sin clonar a una persona real.
Evaluación para desarrolladores
Compara VoxCPM con otros sistemas TTS abiertos, prueba el paquete Python o estudia Nano-vLLM para menor latencia.
Consejos para mejores resultados con VoxCPM
- Empieza con texto corto para evaluar pronunciación, ritmo y consistencia de voz rápidamente.
- Usa audio de referencia limpio y de una sola persona; ruido o múltiples voces dificultan la similitud.
- Si el diseño de voz no acierta, reescribe la descripción con edad, ritmo, emoción y textura vocal concretos.
- Para clonación de alta fidelidad, proporciona la transcripción de referencia cuando la demo la solicite.
- Evita guiones confidenciales o voces privadas en Spaces públicos; autoaloja VoxCPM2 para trabajo sensible.
- No uses VoxCPM para suplantación, fraude o medios sintéticos sin etiquetar. Obtén consentimiento antes de clonar cualquier voz real.
Preguntas frecuentes sobre VoxCPM
Respuestas cortas para evaluar VoxCPM en TTS multilingüe, clonación de voz, diseño de voz y flujos autoalojados.
¿Qué es VoxCPM?
VoxCPM es la familia de texto a voz sin tokenizer de OpenBMB. VoxCPM2 es la versión actual de 2B parámetros para habla multilingüe, diseño de voz y clonación vocal.
¿Puedo probar VoxCPM online?
Sí. Esta página integra el Space oficial VoxCPM-Demo de Hugging Face para probar VoxCPM2 en el navegador sin instalar primero el paquete Python.
¿Qué idiomas soporta VoxCPM2?
La model card pública lista 30 idiomas, incluidos chino, inglés, japonés, coreano, español, francés, alemán, portugués, hindi, árabe, vietnamita y varios dialectos chinos.
¿VoxCPM soporta clonación de voz?
Sí. VoxCPM2 soporta clonación controlable desde audio de referencia y un flujo de mayor fidelidad con clip y transcripción. Clona solo voces con permiso.
¿Qué es el diseño de voz en VoxCPM?
El diseño de voz permite describir una voz en lenguaje natural — edad, género, tono, emoción o ritmo — y generar una voz nueva sin grabación de referencia.
¿La demo integrada de VoxCPM es privada?
No. La app integrada es un Space público de Hugging Face fuera de Whisper AI. Para textos o voces sensibles, autoaloja el modelo.
Prueba VoxCPM en tu navegador
Genera voz multilingüe, prueba diseño de voz y evalúa clonación con consentimiento en la demo oficial de Hugging Face.
