TTS para 600+ idiomas · clonación de voz · demo en vivo

OmniVoice — TTS de clonación de voz para 600+ idiomas

Un modelo de text-to-speech zero-shot multilingüe de k2-fsa, en vivo en el Space oficial de Hugging Face

OmniVoice convierte texto en voz natural en cientos de idiomas, admite clonación de voz con consentimiento a partir de un clip de referencia corto y te permite diseñar voces con atributos como edad, tono, acento y estilo susurrado. Prueba la demo en vivo abajo antes de instalar nada.

600+ idiomasClonación de voz zero-shotControles de voice designLicencia Apache-2.0Space de Hugging Face
OmniVoice · Space oficial de Hugging Face
Abrir en Hugging Face

Este es el Space oficial de OmniVoice alojado en Hugging Face, creado por k2-fsa. La primera ejecución puede tardar más mientras arranca ZeroGPU. Esta página de Whisper AI es una guía independiente con la demo oficial incrustada.

Visión general

¿Qué es OmniVoice?

OmniVoice es un modelo de text-to-speech zero-shot enormemente multilingüe del proyecto k2-fsa. En lugar de ofrecer un puñado de voces fijas, busca la cobertura de idiomas más amplia entre los modelos de TTS abiertos, combinando la clonación de voz a partir de unos pocos segundos de audio de referencia con controles de voice design que construyen un hablante solo a partir de atributos.

Por dentro, OmniVoice se basa en Qwen3-0.6B y en una arquitectura de tipo modelo de lenguaje por difusión, que el equipo usa para acelerar la inferencia sin renunciar a la calidad — la ficha del modelo indica un factor de tiempo real de tan solo 0,025, unas 40 veces más rápido que el tiempo real. El lanzamiento incluye un modelo y un Space en Hugging Face, un artículo en arXiv, un repositorio en GitHub, un cuaderno de Colab y un paquete omnivoice instalable con pip.

Si buscabas una demo de OmniVoice, el Space incrustado de arriba es el camino más rápido: escribe tu texto, elige un idioma, sube un clip corto si quieres clonación, ajusta la configuración de generación y escucha voz de IA en 24 kHz directamente en el navegador.

Funciones

Por qué destaca OmniVoice

OmniVoice reúne generación de voz multilingüe, clonación de voz y voice design en un único flujo de trabajo de modelo abierto.

TTS enormemente multilingüe

OmniVoice apunta a una cobertura de idiomas excepcionalmente amplia; la ficha oficial del modelo lista más de 600 códigos de idioma y dialecto para text-to-speech.

Clonación de voz zero-shot

Sube una grabación de referencia corta y OmniVoice sintetiza texto nuevo en un estilo de voz parecido. Un clip limpio y una transcripción opcional dan la mejor coincidencia.

Voice design sin referencia

¿Sin grabación? Construye una voz sintética a partir de atributos como género, edad, tono, estilo susurrado, acento inglés o dialecto chino.

Generación rápida por difusión

OmniVoice usa una arquitectura de tipo modelo de lenguaje por difusión; la ficha del modelo indica un factor de tiempo real de tan solo 0,025, unas 40 veces más rápido que el tiempo real.

Modelo abierto basado en Qwen3

El modelo se basa en Qwen3-0.6B y se publica como modelo y Space en Hugging Face, como paquete instalable con pip y como repositorio público en GitHub.

Salvaguardas de uso responsable

Las indicaciones oficiales prohíben la clonación no autorizada, la suplantación y el uso ilegal. Clona una voz solo con el permiso de la persona que habla.

Cómo usarlo

Prueba OmniVoice en cuatro pasos

El Space alojado te da los controles principales de OmniVoice sin configuración local.

1

Elige un modo

Abre la demo incrustada de OmniVoice y elige Voice Clone si tienes una grabación de referencia, o Voice Design para construir un hablante a partir de atributos.

2

Introduce texto e idioma

Pega el guion que quieres sintetizar. Deja el idioma en detección automática o elige un idioma concreto en el menú multilingüe.

3

Añade contexto de voz o ajustes de diseño

Para clonación, sube un clip corto y limpio y, opcionalmente, su transcripción. Para diseño, fija atributos como edad, tono, acento o estilo susurrado.

4

Ajusta la generación y escucha

Ajusta velocidad, duración, pasos de inferencia, guidance y denoise, luego genera y reproduce la salida de audio en 24 kHz.

Detalles del modelo

Las capacidades de OmniVoice de un vistazo

Datos clave del Space público de Hugging Face, la ficha del modelo y la interfaz de la demo, reescritos aquí para una evaluación rápida.

Tarea principal
Text-to-speech, clonación de voz zero-shot y voice design
Cobertura de idiomas
600+ códigos de idioma y dialecto listados en la ficha del modelo
Modelo base
Qwen3-0.6B con una arquitectura de tipo modelo de lenguaje por difusión
Velocidad de inferencia
La ficha del modelo indica un factor de tiempo real de tan solo 0,025, unas 40 veces más rápido que el tiempo real
Audio y entrada
Salida en 24 kHz; un clip de referencia corto opcional impulsa la clonación de voz
Control fino
Señales no verbales como [laughter] y corrección de pronunciación mediante pinyin o fonemas
Licencia
Apache-2.0 según los metadatos del modelo y el Space de Hugging Face
Casos de uso

Qué puedes crear con OmniVoice

OmniVoice es especialmente útil cuando un proyecto de voz necesita tanto amplitud multilingüe como un control flexible del hablante.

Localización y doblaje

Crea pistas de voz de borrador en muchos idiomas para vídeos de producto, cursos, narración y trabajo creativo multilingüe.

Prototipar agentes de voz

Prueba personalidades de voz, acentos y ritmo antes de montar una IA conversacional o un agente telefónico en producción.

Contenido de audio accesible

Convierte artículos, documentación y material de estudio en voz para quienes prefieren escuchar o necesitan una alternativa en audio.

Exploración de personajes y estilos

Usa el voice design para explorar edad, tono, susurro y opciones de acento o dialecto sin grabar un hablante de referencia para cada variación.

Investigación y evaluación

Compara la clonación zero-shot, la pronunciación multilingüe y los atributos de hablante controlables con tus propias referencias de TTS.

Experimentos para desarrolladores

Instala el paquete omnivoice o usa el código de GitHub para probar inferencia en Python, generación por lotes y pipelines personalizados.

Buenas prácticas

Consejos para mejores resultados con OmniVoice

  • Usa una grabación de referencia limpia, con un solo hablante, poco ruido de fondo y volumen natural.
  • Mantén la primera prueba corta para revisar rápido la pronunciación, el ritmo y el parecido de la voz.
  • Selecciona el idioma manualmente cuando la detección automática tenga problemas con texto corto o mezclado.
  • Prefiere el voice design para personas sintéticas en vez de clonar a una persona real sin consentimiento.
  • Añade señales no verbales como [laughter] o corrige palabras difíciles con pinyin o fonemas para afinar una toma.
  • No pegues guiones confidenciales en una demo pública; instala el paquete omnivoice para ejecutar tú mismo los trabajos sensibles.
FAQ

Preguntas frecuentes sobre OmniVoice

Respuestas breves para quien evalúa OmniVoice para clonación de voz con IA, TTS multilingüe y voice design.

¿Qué es OmniVoice?

OmniVoice es un modelo de text-to-speech zero-shot enormemente multilingüe del proyecto k2-fsa. Puede sintetizar voz en más de 600 idiomas, clonar una voz a partir de un clip de referencia corto y diseñar voces a partir de atributos de hablante.

¿Puedo probar OmniVoice online gratis?

Sí. El panel de arriba incrusta el Space oficial de OmniVoice en Hugging Face, así que puedes probar la demo en vivo en tu navegador sin instalar primero el paquete de Python.

¿OmniVoice admite clonación de voz?

Sí. En el modo Voice Clone, OmniVoice usa un clip de audio de referencia corto y una transcripción opcional para guiar la voz generada. Clona solo voces que poseas o para las que tengas permiso explícito.

¿Qué es el voice design de OmniVoice?

El voice design te permite fijar atributos de hablante como género, edad, tono, estilo susurrado, acento inglés o dialecto chino y, luego, generar una voz sin ninguna grabación de referencia.

¿Cuántos idiomas admite OmniVoice?

La ficha oficial del modelo lista más de 600 códigos de idioma y dialecto, una de las coberturas más amplias entre los modelos de TTS zero-shot abiertos. Prueba tu idioma objetivo en el Space en vivo antes de pasar a producción.

¿OmniVoice es de código abierto?

OmniVoice se basa en Qwen3-0.6B y se publica bajo la licencia Apache-2.0, con un modelo y un Space en Hugging Face, un repositorio en GitHub y un paquete omnivoice instalable con pip. Revisa la licencia antes de un uso comercial.

¿La demo alojada de OmniVoice es privada?

La demo incrustada está alojada por Hugging Face, no por Whisper AI. Evita introducir texto o audio sensible en el Space público; instala el paquete omnivoice y ejecuta el modelo tú mismo para trabajos confidenciales.

Prueba OmniVoice en tu navegador

Genera voz multilingüe, prueba la clonación de voz con permiso y explora los controles de voice design en la demo oficial de Hugging Face.