VoxCPM2 · TTS em 30 idiomas · clonagem de voz

VoxCPM — TTS multilíngue sem tokenizer com clonagem de voz

O modelo VoxCPM2 da OpenBMB, incorporado a partir do Space oficial do Hugging Face

Teste o VoxCPM online para texto para fala multilíngue, voice design, clonagem de voz controlável e fala de IA em 48 kHz. Esta página reescreve os fatos públicos do VoxCPM2 em um guia independente e indexável.

2B parâmetros30 idiomasVoice designClonagem controlávelSaída 48 kHzApache-2.0
VoxCPM2 · Space oficial do Hugging Face
Abrir no Hugging Face

Este é o Space oficial VoxCPM-Demo hospedado no Hugging Face por OpenBMB. A primeira execução pode ser mais lenta enquanto a demo hospedada inicializa. Evite textos confidenciais ou amostras privadas de voz em um Space público.

Resposta rápida

O que é VoxCPM?

VoxCPM é uma família aberta de modelos de texto para fala da OpenBMB. A versão atual VoxCPM2 foca em fala multilíngue natural, voice design criativo e clonagem de voz realista, sem uma pipeline baseada em tokens discretos de fala.

Segundo o model card e a documentação pública, VoxCPM2 é um modelo TTS diffusion autoregressivo sem tokenizer, com 2B parâmetros, treinado em mais de 2 milhões de horas de fala multilíngue. Ele suporta 30 idiomas, aceita áudio curto de referência para clonagem e gera fala em 48 kHz via AudioVAE V2.

O Space incorporado facilita a avaliação rápida: TTS multilíngue direto, voice design por linguagem natural, clonagem controlável com orientação de estilo e clonagem de maior fidelidade com áudio de referência e transcrição.

Recursos

Por que o VoxCPM2 se destaca

VoxCPM combina geração multilíngue, voice design, clonagem e uma rota de serving voltada à produção em um fluxo aberto.

TTS diffusion autoregressivo sem tokenizer

VoxCPM2 gera representações contínuas de fala diretamente por uma arquitetura diffusion autoregressiva, sem depender de tokens discretos de fala.

Fala multilíngue em 30 idiomas

O model card lista 30 idiomas, incluindo chinês, inglês, japonês, coreano, espanhol, francês, alemão, português, hindi, árabe, vietnamita e mais.

Voice design em linguagem natural

Descreva uma voz com gênero, idade, tom, emoção ou ritmo para o VoxCPM2 criar uma nova voz sintética sem áudio de referência.

Clonagem controlável e de alta fidelidade

Envie um clipe curto para preservar o timbre, adicione orientação de estilo ou forneça uma transcrição para clonagem de continuação com mais fidelidade.

Saída 48 kHz e caminho de streaming

VoxCPM2 aceita áudio de referência em 16 kHz e gera fala em 48 kHz; a documentação relata streaming em tempo real e serving Nano-vLLM mais rápido.

Lançamento aberto e atento à segurança

O lançamento é Apache-2.0, mas o projeto proíbe personificação, fraude e desinformação. Rotule áudio gerado por IA claramente.

Como usar

Teste o VoxCPM em quatro passos

O Space hospedado oferece os principais fluxos do VoxCPM2 sem configuração local.

1

Abra o Space VoxCPM

Use o Space do Hugging Face incorporado ou abra em nova aba. Cold starts podem demorar enquanto ambiente e modelo carregam.

2

Insira texto em um idioma suportado

Cole um roteiro curto. VoxCPM2 foi desenhado para entrada multilíngue sem uma tag de idioma separada.

3

Escolha voice design ou clonagem

Para voice design, descreva o falante. Para clonagem, envie um clipe limpo e use orientação de estilo quando quiser alterar ritmo ou emoção.

4

Ajuste e ouça

Altere passos de inferência, guidance, denoise ou estilo, gere uma amostra curta e refine pronúncia, ritmo e personalidade.

Detalhes do modelo

Capacidades do VoxCPM em resumo

Fatos públicos do model card, metadados do Space, documentação e página de demo, reescritos para avaliação rápida.

Família do modelo
VoxCPM / VoxCPM2 da OpenBMB
Tarefa principal
Texto para fala multilíngue, voice design, clonagem controlável e clonagem de alta fidelidade
Arquitetura
Pipeline TTS diffusion autoregressiva sem tokenizer descrita como LocEnc → TSLM → RALM → LocDiT
Tamanho e backbone
2B parâmetros, construído sobre um backbone MiniCPM-4
Escala de treino
Mais de 2 milhões de horas de dados de fala multilíngue segundo o model card público
Cobertura de idiomas
30 idiomas e dialetos chineses listados, incluindo sichuanês, cantonês, wu e mandarim do nordeste
Qualidade de áudio
Aceita áudio de referência em 16 kHz e gera fala em 48 kHz via AudioVAE V2
Demo hospedada
Space Gradio oficial openbmb/VoxCPM-Demo, atualmente servido por openbmb-voxcpm-demo.hf.space
Licença
Apache-2.0 conforme metadados do modelo VoxCPM2 e do Space
Casos de uso

O que você pode criar com VoxCPM

VoxCPM é útil quando um projeto de voz precisa de alcance multilíngue, expressão controlável e opção de self-hosting.

Narração de produto multilíngue

Crie rascunhos de voiceover para tours, aulas e vídeos explicativos em vários idiomas antes da gravação humana final.

Prototipagem de agentes de voz

Explore personas, velocidade, emoção e qualidade 48 kHz antes de conectar uma stack de agente de voz em produção.

Testes de dublagem e localização

Avalie pronúncia, ritmo e expressividade de roteiros localizados em idiomas que TTS antigos atendem pior.

Clonagem de voz com consentimento

Clone uma voz apenas com permissão e use orientação controlável para testar emoções ou ritmo preservando o timbre.

Personagens sintéticos

Use voice design quando precisar de uma voz fictícia ou segura para marca sem clonar uma pessoa real.

Avaliação para desenvolvedores

Compare VoxCPM com outros TTS abertos, teste o pacote Python ou estude Nano-vLLM para reduzir latência.

Boas práticas

Dicas para melhores resultados com VoxCPM

  • Comece com texto curto para avaliar rapidamente pronúncia, ritmo e consistência de voz.
  • Use áudio de referência limpo e com uma única pessoa; ruído ou múltiplas vozes reduzem a similaridade.
  • Se o voice design errar o alvo, reescreva a descrição com idade, ritmo, emoção e textura vocal concretos.
  • Para clonagem de alta fidelidade, forneça a transcrição de referência quando a demo solicitar.
  • Evite scripts confidenciais ou vozes privadas em Spaces públicos; auto-hospede o VoxCPM2 para trabalho sensível.
  • Não use VoxCPM para personificação, fraude ou mídia sintética sem aviso. Obtenha consentimento antes de clonar qualquer voz real.
FAQ

Perguntas frequentes sobre VoxCPM

Respostas curtas para avaliar VoxCPM em TTS multilíngue, clonagem de voz, voice design e fluxos auto-hospedados.

O que é VoxCPM?

VoxCPM é a família de texto para fala sem tokenizer da OpenBMB. VoxCPM2 é a versão atual de 2B parâmetros para fala multilíngue, voice design e clonagem de voz.

Posso testar VoxCPM online?

Sim. Esta página incorpora o Space oficial VoxCPM-Demo no Hugging Face, para testar VoxCPM2 no navegador antes de instalar o pacote Python.

Quais idiomas o VoxCPM2 suporta?

O model card público lista 30 idiomas, incluindo chinês, inglês, japonês, coreano, espanhol, francês, alemão, português, hindi, árabe, vietnamita e vários dialetos chineses.

VoxCPM suporta clonagem de voz?

Sim. VoxCPM2 suporta clonagem controlável com áudio de referência e um fluxo de maior fidelidade com referência e transcrição. Clone apenas vozes com permissão.

O que é voice design no VoxCPM?

Voice design permite descrever uma voz em linguagem natural — idade, gênero, tom, emoção ou ritmo — e gerar uma nova voz sem gravação de referência.

A demo incorporada do VoxCPM é privada?

Não. A app incorporada é um Space público do Hugging Face fora da Whisper AI. Para textos ou vozes sensíveis, auto-hospede o modelo.

Teste o VoxCPM no navegador

Gere fala multilíngue, teste voice design e avalie clonagem com consentimento na demo oficial do Hugging Face.