Miso One — Text-to-Speech de IA emotivo
El modelo MisoTTS de Miso Labs, en vivo en tu navegador
Miso One es un modelo de text-to-speech de pesos abiertos con unos 8 mil millones de parámetros, creado para sonar genuinamente humano: cálido, expresivo y emotivo. Escribe cualquier texto en inglés abajo y escucha un habla de IA viva, o clona una voz a partir de un clip corto.
La demo es el Space oficial de MisoTTS alojado en Hugging Face. La primera generación puede tardar un poco más mientras la GPU se calienta. Miso One y MisoTTS son productos de Miso Labs; esta página es una guía independiente que incrusta la demo oficial.
¿Qué es Miso One?
Miso One es un modelo de text-to-speech de IA muy expresivo de Miso Labs, una startup de voice AI respaldada por Y Combinator. Lanzado a principios de junio de 2026 con el nombre técnico MisoTTS, es un modelo de síntesis de voz con unos 8 mil millones de parámetros, diseñado para hacer que las voces de IA suenen genuinamente humanas, con calidez, ritmo y emoción, donde la mayoría de los sistemas TTS aún suena sin vida.
Internamente, Miso One combina un backbone al estilo Llama 3.2 con un decoder de audio autorregresivo más pequeño —un RVQ Transformer inspirado en la arquitectura CSM de Sesame— y genera códigos de audio Mimi a partir de tu texto y de un contexto de audio opcional. Admite clonación de voz one-shot a partir de un clip de unos 10 segundos, y Miso Labs lo publicó con pesos abiertos para que los desarrolladores puedan ejecutarlo por su cuenta.
El panel interactivo en la parte superior de esta página es el Space oficial de MisoTTS en Hugging Face, así que puedes probar Miso One como generador de voz con IA ahora mismo, sin instalar nada.
Por qué Miso One destaca
Una entrega emotiva, la clonación de voz y los pesos abiertos hacen de Miso One un modelo de text-to-speech capaz y amigable para desarrolladores.
Habla genuinamente emotiva
Miso One está hecho para leerse como una persona real —con calidez, ritmo y emoción— en lugar de la entrega plana y robótica que la mayoría de los sistemas text-to-speech aún produce.
Clonación de voz one-shot
Clona una voz a partir de un clip de referencia de unos 10 segundos y haz que Miso One narre nuevas frases con esa voz. Usa la clonación solo con el consentimiento de la persona.
Generación de baja latencia
Miso Labs reporta una latencia de primer token en torno a 110 ms para una reproducción receptiva y conversacional. Trata la cifra como un benchmark del proveedor.
Arquitectura con ~8B de parámetros
Un backbone al estilo Llama 3.2 combinado con un decoder de audio más pequeño —un RVQ Transformer inspirado en el CSM de Sesame— que genera códigos de audio Mimi a partir del texto.
Pesos abiertos, autoalojable
Lanzado con pesos abiertos bajo una licencia MIT modificada, Miso One puede ejecutarse localmente para mantener tu audio y texto en tu propia máquina.
Pensado para desarrolladores
Descarga los pesos MisoLabs/MisoTTS de Hugging Face e intégralos en tu stack. Miso Labs indica que una API alojada está en camino.
Voces expresivas en inglés
Miso One se centra hoy en un habla en inglés natural, con entonación, énfasis y fraseo vivos que siguen tu puntuación.
Salida sensible al tono
El modelo se condiciona a tu texto y a un contexto de audio opcional, para que la entrega acompañe el ánimo y la energía que buscas.
Genera habla con Miso One en cuatro pasos
Todo ocurre en la demo incrustada arriba: no se necesita ninguna cuenta ni configuración para empezar.
Escribe o pega tu texto
Introduce en la demo de Miso One de arriba el texto en inglés que quieres escuchar hablado. La puntuación y el fraseo natural guían la emoción y el ritmo.
Añade una voz de referencia (opcional)
Proporciona un clip de referencia corto y limpio —de unos 10 segundos— si quieres que Miso One clone una voz específica para la salida.
Ajusta y genera
Usa los controles de expresividad o de longitud que ofrezca la demo y genera. La primera ejecución puede ser más lenta mientras el Space de Hugging Face se calienta.
Reproduce, descarga o autoaloja
Escucha y descarga el audio generado. Para uso en producción, ejecuta tú mismo los pesos abiertos de MisoTTS para que tus datos nunca salgan de tu infraestructura.
Qué puedes crear con Miso One
El habla de IA emotiva encaja en una amplia variedad de productos de voz y audio.
Locución y narración
Produce narraciones expresivas para vídeos explicativos, anuncios y vídeos sociales sin reservar una sesión de estudio.
Agentes de voz conversacionales
Dale a asistentes, IVR y bots de soporte una voz que suena humana, gracias a la entrega emotiva y de baja latencia.
Audiolibros y e-learning
Convierte guiones largos y cursos en habla de sonido natural, con ritmo y tono consistentes.
Diálogos de juegos y personajes
Prototipa o entrega líneas de personajes con voces distintas y emotivas usando la clonación de voz one-shot.
Accesibilidad
Lee artículos, documentos y la interfaz en voz alta con una voz más fácil y agradable de escuchar.
Podcasts y creación de contenido
Crea introducciones, lecturas de anuncios y segmentos, o genera una voz consistente para contenido recurrente.
Consejos para mejores resultados
- Escribe tal como quieres que se hable: comas, puntos y saltos de línea moldean el ritmo y el énfasis de Miso One.
- Para la clonación de voz, usa un clip mono limpio de unos 10 segundos, con el mínimo de ruido de fondo, para la mejor correspondencia.
- Divide los guiones largos en frases naturales; genera sección por sección en lugar de un único bloque enorme.
- La primera generación puede ser lenta mientras el Space ZeroGPU se inicializa; las ejecuciones siguientes son más rápidas.
- No pegues textos sensibles o privados en la demo pública. Para trabajos confidenciales, autoaloja los pesos abiertos.
Preguntas frecuentes sobre Miso One
Respuestas a las preguntas comunes sobre Miso One, MisoTTS y Miso Labs.
¿Qué es Miso One?
Miso One es un modelo de text-to-speech (TTS) de IA abierto y muy expresivo de Miso Labs. Genera un habla en inglés viva y expresiva a partir de texto y puede clonar una voz a partir de un clip de referencia corto. El panel interactivo de arriba es la demo oficial de MisoTTS ejecutándose en Hugging Face.
¿Miso One es lo mismo que MisoTTS?
Sí. «Miso One» es el nombre del producto y «MisoTTS» es el nombre del lanzamiento open source y del repositorio del mismo modelo. Verás el nombre MisoTTS en el proyecto de GitHub y en el modelo y Space de Hugging Face.
¿Quién creó Miso One?
Miso One fue desarrollado por Miso Labs, una startup respaldada por Y Combinator y centrada en voice AI emotiva. Se lanzó con pesos abiertos a principios de junio de 2026.
¿Miso One es gratuito y open source?
La demo de arriba es gratuita para probar en el navegador, y Miso Labs publicó el modelo con pesos abiertos bajo una licencia MIT modificada. Revisa los términos exactos de la licencia en el repositorio oficial antes de usarlo comercialmente.
¿Qué idiomas admite Miso One?
Miso One se centra en inglés hoy. Otros idiomas no están documentados como compatibles en el lanzamiento.
¿Miso One puede clonar una voz?
Sí. Miso Labs describe la clonación de voz one-shot a partir de un clip de referencia de unos 10 segundos. Clona solo voces que tengas permiso para usar y respeta las leyes aplicables y las reglas de las plataformas.
¿Qué tamaño tiene el modelo y qué velocidad alcanza?
Miso One se describe como un modelo con unos 8 mil millones de parámetros (un backbone al estilo Llama 3.2 más un decoder de audio). Miso Labs reporta una latencia de primer token en torno a 110 ms; esa cifra es una afirmación del proveedor, no un benchmark independiente.
¿Mis datos permanecen privados?
Como los pesos son abiertos, puedes autoalojar Miso One y mantener audio y texto enteramente en tu propia máquina. La demo alojada de arriba se ejecuta en Hugging Face, así que evita pegar contenido confidencial en ella.
Escucha Miso One tú mismo
Escribe una frase, elige una voz y escucha un habla de IA emotiva en segundos; luego explora los pesos abiertos para construir con MisoTTS.
