TTS para 600+ idiomas · clonagem de voz · demo ao vivo

OmniVoice — TTS de clonagem de voz para 600+ idiomas

Um modelo de text-to-speech zero-shot multilíngue da k2-fsa, rodando no Space oficial do Hugging Face

O OmniVoice transforma texto em fala natural em centenas de idiomas, oferece clonagem de voz com consentimento a partir de um clipe de referência curto e permite projetar vozes com atributos como idade, tom, sotaque e estilo sussurrado. Teste a demo ao vivo abaixo antes de instalar qualquer coisa.

600+ idiomasClonagem de voz zero-shotControles de voice designLicença Apache-2.0Space do Hugging Face
OmniVoice · Space oficial do Hugging Face
Abrir no Hugging Face

Este é o Space oficial do OmniVoice hospedado no Hugging Face, criado pela k2-fsa. A primeira execução pode demorar mais enquanto o ZeroGPU inicia. Esta página da Whisper AI é um guia independente com a demo oficial incorporada.

Visão geral

O que é o OmniVoice?

O OmniVoice é um modelo de text-to-speech zero-shot amplamente multilíngue do projeto k2-fsa. Em vez de entregar um punhado de vozes fixas, ele busca a mais ampla cobertura de idiomas entre os modelos de TTS abertos, combinando clonagem de voz a partir de poucos segundos de áudio de referência com controles de voice design que constroem um locutor apenas a partir de atributos.

Internamente, o OmniVoice é baseado no Qwen3-0.6B com uma arquitetura no estilo modelo de linguagem por difusão, que a equipe usa para aumentar a velocidade de inferência sem abrir mão da qualidade — o cartão do modelo informa um fator de tempo real tão baixo quanto 0,025, cerca de 40 vezes mais rápido que o tempo real. O lançamento inclui um modelo e um Space no Hugging Face, um artigo no arXiv, um repositório no GitHub, um notebook no Colab e um pacote omnivoice instalável via pip.

Se você procurou por uma demo do OmniVoice, o Space incorporado acima é o caminho mais rápido: digite o texto, escolha um idioma, envie um clipe curto se quiser clonagem, ajuste as configurações de geração e ouça a fala de IA em 24 kHz direto no navegador.

Recursos

Por que o OmniVoice se destaca

O OmniVoice combina geração de fala multilíngue, clonagem de voz e voice design em um único fluxo de trabalho de modelo aberto.

TTS amplamente multilíngue

O OmniVoice busca uma cobertura de idiomas excepcionalmente ampla; o cartão oficial do modelo lista mais de 600 códigos de idioma e dialeto para text-to-speech.

Clonagem de voz zero-shot

Envie uma gravação de referência curta e o OmniVoice sintetiza um novo texto em um estilo de voz parecido. Um clipe limpo e uma transcrição opcional dão a melhor correspondência.

Voice design sem referência

Sem gravação? Construa uma voz sintética a partir de atributos como gênero, idade, tom, estilo sussurrado, sotaque inglês ou dialeto chinês.

Geração rápida por difusão

O OmniVoice usa uma arquitetura no estilo modelo de linguagem por difusão; o cartão do modelo informa um fator de tempo real tão baixo quanto 0,025, cerca de 40 vezes mais rápido que o tempo real.

Modelo aberto baseado no Qwen3

O modelo é baseado no Qwen3-0.6B e publicado como modelo e Space no Hugging Face, como pacote instalável via pip e como repositório público no GitHub.

Salvaguardas de uso responsável

As orientações oficiais proíbem clonagem não autorizada, falsidade ideológica e uso ilegal. Clone uma voz apenas com a permissão da pessoa que fala.

Como usar

Teste o OmniVoice em quatro passos

O Space hospedado oferece os principais controles do OmniVoice sem configuração local.

1

Escolha um modo

Abra a demo incorporada do OmniVoice e escolha Voice Clone se tiver uma gravação de referência, ou Voice Design para construir um locutor a partir de atributos.

2

Insira texto e idioma

Cole o roteiro que quer sintetizar. Mantenha o idioma na detecção automática ou escolha um idioma específico no menu multilíngue.

3

Adicione contexto de voz ou configurações de design

Para clonagem, envie um clipe curto e limpo e, opcionalmente, sua transcrição. Para design, defina atributos como idade, tom, sotaque ou estilo sussurrado.

4

Ajuste a geração e ouça

Ajuste velocidade, duração, passos de inferência, guidance e denoise, depois gere e reproduza a saída de áudio em 24 kHz.

Detalhes do modelo

Os recursos do OmniVoice em resumo

Fatos-chave do Space público no Hugging Face, do cartão do modelo e da interface da demo, reescritos aqui para uma avaliação rápida.

Tarefa principal
Text-to-speech, clonagem de voz zero-shot e voice design
Cobertura de idiomas
600+ códigos de idioma e dialeto listados no cartão do modelo
Modelo base
Qwen3-0.6B com arquitetura no estilo modelo de linguagem por difusão
Velocidade de inferência
O cartão do modelo informa um fator de tempo real tão baixo quanto 0,025, cerca de 40 vezes mais rápido que o tempo real
Áudio e entrada
Saída em 24 kHz; um clipe de referência curto opcional conduz a clonagem de voz
Controle fino
Pistas não verbais como [laughter] e correção de pronúncia via pinyin ou fonemas
Licença
Apache-2.0 conforme os metadados do modelo e do Space no Hugging Face
Casos de uso

O que você pode criar com o OmniVoice

O OmniVoice é especialmente útil quando um projeto de voz precisa tanto de amplitude multilíngue quanto de controle flexível do locutor.

Localização e dublagem

Crie faixas de voz de rascunho em vários idiomas para vídeos de produto, cursos, narração e trabalho criativo multilíngue.

Prototipar agentes de voz

Teste personalidades de voz, sotaques e ritmo antes de montar uma IA conversacional ou um agente de telefone em produção.

Conteúdo de áudio acessível

Transforme artigos, documentação e material de estudo em fala para quem prefere ouvir ou precisa de uma alternativa em áudio.

Exploração de personagens e estilos

Use o voice design para explorar idade, tom, sussurro e opções de sotaque ou dialeto sem gravar um locutor de referência para cada variação.

Pesquisa e avaliação

Compare clonagem zero-shot, pronúncia multilíngue e atributos de locutor controláveis com suas próprias referências de TTS.

Experimentos de desenvolvedor

Instale o pacote omnivoice ou use o código do GitHub para testar inferência em Python, geração em lote e pipelines personalizados.

Boas práticas

Dicas para melhores resultados com o OmniVoice

  • Use uma gravação de referência limpa, com um único locutor, pouco ruído de fundo e volume natural.
  • Mantenha o primeiro teste curto para verificar rapidamente pronúncia, ritmo e semelhança de voz.
  • Selecione o idioma manualmente quando a detecção automática tiver dificuldade com texto curto ou misturado.
  • Prefira o voice design para personas sintéticas em vez de clonar uma pessoa real sem consentimento.
  • Adicione pistas não verbais como [laughter] ou corrija palavras difíceis com pinyin ou fonemas para refinar uma gravação.
  • Não cole roteiros confidenciais em uma demo pública; instale o pacote omnivoice para executar você mesmo as tarefas sensíveis.
FAQ

Perguntas frequentes sobre o OmniVoice

Respostas curtas para quem avalia o OmniVoice para clonagem de voz com IA, TTS multilíngue e voice design.

O que é o OmniVoice?

O OmniVoice é um modelo de text-to-speech zero-shot amplamente multilíngue do projeto k2-fsa. Ele pode sintetizar fala em mais de 600 idiomas, clonar uma voz a partir de um clipe de referência curto e projetar vozes a partir de atributos de locutor.

Posso testar o OmniVoice online de graça?

Sim. O painel acima incorpora o Space oficial do OmniVoice no Hugging Face, então você pode testar a demo ao vivo no navegador sem instalar primeiro o pacote Python.

O OmniVoice oferece clonagem de voz?

Sim. No modo Voice Clone, o OmniVoice usa um clipe de áudio de referência curto e uma transcrição opcional para guiar a voz gerada. Clone apenas vozes que você possui ou para as quais tem permissão explícita.

O que é o voice design do OmniVoice?

O voice design permite definir atributos de locutor como gênero, idade, tom, estilo sussurrado, sotaque inglês ou dialeto chinês e, então, gerar uma voz sem nenhuma gravação de referência.

Quantos idiomas o OmniVoice suporta?

O cartão oficial do modelo lista mais de 600 códigos de idioma e dialeto — uma das maiores coberturas entre os modelos de TTS zero-shot abertos. Teste seu idioma alvo no Space ao vivo antes de ir para produção.

O OmniVoice é open source?

O OmniVoice é baseado no Qwen3-0.6B e publicado sob a licença Apache-2.0, com um modelo e um Space no Hugging Face, um repositório no GitHub e um pacote omnivoice instalável via pip. Revise a licença antes do uso comercial.

A demo hospedada do OmniVoice é privada?

A demo incorporada é hospedada pelo Hugging Face, não pela Whisper AI. Evite inserir texto ou áudio sensível no Space público; instale o pacote omnivoice e rode o modelo você mesmo para trabalhos confidenciais.

Teste o OmniVoice no seu navegador

Gere fala multilíngue, teste a clonagem de voz com permissão e explore os controles de voice design na demo oficial do Hugging Face.