Pesos abertos · TTS emotivo · demo ao vivo

Miso One — Text-to-Speech de IA emotivo

O modelo MisoTTS da Miso Labs, ao vivo no seu navegador

O Miso One é um modelo de text-to-speech de pesos abertos com cerca de 8 bilhões de parâmetros, criado para soar genuinamente humano — caloroso, expressivo e emotivo. Digite qualquer texto em inglês abaixo e ouça uma fala de IA viva, ou clone uma voz a partir de um clipe curto.

~8B de parâmetrosClonagem de voz one-shotPesos abertos (MIT modificada)Vozes em inglêsRoda no navegador
Miso One · demo MisoTTS ao vivo
Abrir no Hugging Face

A demo é o Space oficial do MisoTTS hospedado no Hugging Face. A primeira geração pode demorar um pouco mais enquanto a GPU aquece. Miso One e MisoTTS são produtos da Miso Labs; esta página é um guia independente que incorpora a demo oficial.

Visão geral

O que é o Miso One?

O Miso One é um modelo de text-to-speech de IA altamente expressivo da Miso Labs, uma startup de voice AI apoiada pela Y Combinator. Lançado no início de junho de 2026 sob o nome técnico MisoTTS, é um modelo de síntese de voz com cerca de 8 bilhões de parâmetros, projetado para fazer as vozes de IA soarem genuinamente humanas — com calor, ritmo e emoção, onde a maioria dos sistemas TTS ainda soa sem vida.

Internamente, o Miso One combina um backbone no estilo Llama 3.2 com um decoder de áudio autorregressivo menor — um RVQ Transformer inspirado na arquitetura CSM da Sesame — e gera códigos de áudio Mimi a partir do seu texto e de um contexto de áudio opcional. Ele suporta clonagem de voz one-shot a partir de um clipe de cerca de 10 segundos, e a Miso Labs o publicou com pesos abertos para que os desenvolvedores possam executá-lo por conta própria.

O painel interativo no topo desta página é o Space oficial do MisoTTS no Hugging Face, então você pode experimentar o Miso One como gerador de voz com IA agora mesmo — sem instalar nada.

Recursos

Por que o Miso One se destaca

Uma entrega emotiva, a clonagem de voz e os pesos abertos fazem do Miso One um modelo de text-to-speech capaz e amigável para desenvolvedores.

Fala genuinamente emotiva

O Miso One foi feito para ler como uma pessoa de verdade — com calor, ritmo e emoção — em vez da entrega plana e robótica que a maioria dos sistemas text-to-speech ainda produz.

Clonagem de voz one-shot

Clone uma voz a partir de um clipe de referência de cerca de 10 segundos e faça o Miso One narrar novas frases nessa voz. Use a clonagem apenas com o consentimento da pessoa.

Geração de baixa latência

A Miso Labs informa uma latência de primeiro token em torno de 110 ms para uma reprodução responsiva e conversacional. Trate o número como um benchmark do fornecedor.

Arquitetura com ~8B de parâmetros

Um backbone no estilo Llama 3.2 combinado com um decoder de áudio menor — um RVQ Transformer inspirado no CSM da Sesame — que gera códigos de áudio Mimi a partir do texto.

Pesos abertos, auto-hospedável

Lançado com pesos abertos sob uma licença MIT modificada, o Miso One pode ser executado localmente para manter o seu áudio e texto na sua própria máquina.

Feito para desenvolvedores

Baixe os pesos MisoLabs/MisoTTS do Hugging Face e integre-os à sua stack. A Miso Labs indica que uma API hospedada está a caminho.

Vozes expressivas em inglês

O Miso One foca hoje em uma fala em inglês natural, com entonação, ênfase e fraseado vivos que seguem a sua pontuação.

Saída sensível ao tom

O modelo se condiciona ao seu texto e a um contexto de áudio opcional, para que a entrega acompanhe o clima e a energia que você busca.

Como usar

Gere fala com o Miso One em quatro passos

Tudo acontece na demo incorporada acima — nenhuma conta ou configuração é necessária para começar.

1

Digite ou cole o seu texto

Insira na demo do Miso One acima o texto em inglês que você quer ouvir falado. A pontuação e o fraseado natural orientam a emoção e o ritmo.

2

Adicione uma voz de referência (opcional)

Forneça um clipe de referência curto e limpo — cerca de 10 segundos — se quiser que o Miso One clone uma voz específica para a saída.

3

Ajuste e gere

Use os controles de expressividade ou de comprimento que a demo oferecer e gere. A primeira execução pode ser mais lenta enquanto o Space do Hugging Face aquece.

4

Reproduza, baixe ou auto-hospede

Ouça e baixe o áudio gerado. Para uso em produção, execute você mesmo os pesos abertos do MisoTTS para que os seus dados nunca saiam da sua infraestrutura.

Casos de uso

O que você pode criar com o Miso One

A fala de IA emotiva se encaixa em uma ampla variedade de produtos de voz e áudio.

Locução e narração

Produza narrações expressivas para vídeos explicativos, anúncios e vídeos sociais sem reservar uma sessão de estúdio.

Agentes de voz conversacionais

Dê a assistentes, URAs e bots de suporte uma voz que soa humana, graças à entrega emotiva e de baixa latência.

Audiolivros e e-learning

Transforme roteiros longos e cursos em fala de som natural, com ritmo e tom consistentes.

Diálogos de jogos e personagens

Prototipe ou entregue falas de personagens com vozes distintas e emotivas usando a clonagem de voz one-shot.

Acessibilidade

Leia artigos, documentos e a interface em voz alta com uma voz mais fácil e agradável de ouvir.

Podcasts e criação de conteúdo

Crie introduções, leituras de anúncios e segmentos, ou gere uma voz consistente para conteúdo recorrente.

Dicas

Dicas para melhores resultados

  • Escreva do jeito que você quer que seja falado — vírgulas, pontos e quebras de linha moldam o ritmo e a ênfase do Miso One.
  • Para clonagem de voz, use um clipe mono limpo de cerca de 10 segundos, com o mínimo de ruído de fundo, para a melhor correspondência.
  • Divida roteiros longos em frases naturais; gere seção por seção em vez de um único bloco enorme.
  • A primeira geração pode ser lenta enquanto o Space ZeroGPU inicializa — as execuções seguintes são mais rápidas.
  • Não cole textos sensíveis ou privados na demo pública. Para trabalhos confidenciais, auto-hospede os pesos abertos.
FAQ

Perguntas frequentes sobre o Miso One

Respostas às perguntas comuns sobre Miso One, MisoTTS e Miso Labs.

O que é o Miso One?

O Miso One é um modelo de text-to-speech (TTS) de IA aberto e altamente expressivo da Miso Labs. Ele gera uma fala em inglês viva e expressiva a partir de texto e pode clonar uma voz a partir de um clipe de referência curto. O painel interativo acima é a demo oficial do MisoTTS rodando no Hugging Face.

O Miso One é o mesmo que o MisoTTS?

Sim. “Miso One” é o nome do produto e “MisoTTS” é o nome do lançamento open source e do repositório do mesmo modelo. Você verá o nome MisoTTS no projeto do GitHub e no modelo e Space do Hugging Face.

Quem criou o Miso One?

O Miso One foi desenvolvido pela Miso Labs, uma startup apoiada pela Y Combinator e focada em voice AI emotiva. Ele foi lançado com pesos abertos no início de junho de 2026.

O Miso One é gratuito e open source?

A demo acima é gratuita para experimentar no navegador, e a Miso Labs publicou o modelo com pesos abertos sob uma licença MIT modificada. Revise os termos exatos da licença no repositório oficial antes de usá-lo comercialmente.

Quais idiomas o Miso One suporta?

O Miso One foca em inglês hoje. Outros idiomas não estão documentados como suportados no lançamento.

O Miso One pode clonar uma voz?

Sim. A Miso Labs descreve a clonagem de voz one-shot a partir de um clipe de referência de cerca de 10 segundos. Clone apenas vozes que você tem permissão para usar e siga as leis aplicáveis e as regras das plataformas.

Qual é o tamanho do modelo e qual a sua velocidade?

O Miso One é descrito como um modelo com cerca de 8 bilhões de parâmetros (um backbone no estilo Llama 3.2 mais um decoder de áudio). A Miso Labs informa uma latência de primeiro token em torno de 110 ms; esse número é uma afirmação do fornecedor, não um benchmark independente.

Os meus dados permanecem privados?

Como os pesos são abertos, você pode auto-hospedar o Miso One e manter áudio e texto inteiramente na sua própria máquina. A demo hospedada acima roda no Hugging Face, então evite colar conteúdo confidencial nela.

Ouça o Miso One você mesmo

Digite uma frase, escolha uma voz e ouça uma fala de IA emotiva em segundos — depois explore os pesos abertos para construir com o MisoTTS.