Modelo aberto da NVIDIA · reconhecimento de fala em streaming

Nemotron 3.5 ASR — Speech-to-Text NVIDIA em streaming

Experimente o Nemotron AI para converter áudio em texto no seu navegador

O Nemotron é a família de modelos abertos da NVIDIA, e o Nemotron 3.5 ASR é o seu modelo multilíngue de reconhecimento de fala em streaming com 0,6 bilhão de parâmetros. Envie um clipe ou cole uma URL de áudio abaixo para obter, em segundos, uma transcrição com pontuação.

0,6 bi de parâmetros~40 locais de idiomaFastConformer-RNNT com reconhecimento de cacheStreamingPontuação e maiúsculas
Nemotron 3.5 ASR · demo ao vivo

Use a detecção automática a menos que você saiba o idioma principalmente falado.

Aceleração

Uma aceleração maior usa segmentos de streaming menores para reduzir a latência; none mantém segmentos de 1,12 s para a melhor precisão, enquanto full usa segmentos de 0,08 s para a menor latência.

para executar a demo. Contas novas recebem créditos iniciais gratuitos; depois, cada execução custa 1 crédito.

Atenção: esta demo envia o áudio ao endpoint hospedado da NVIDIA Nemotron 3.5 ASR na fal através do nosso servidor. Se o provedor estiver indisponível, o seu áudio pode ser transcrito com segurança no workspace Whisper AI.

Este é um guia independente. Nemotron e Nemotron 3.5 ASR são produtos da NVIDIA; a demo é executada pelo endpoint fal hospedado nvidia/nemotron-asr-multilingual/asr .

Visão geral

O que é o Nemotron 3.5 ASR?

O Nemotron 3.5 ASR é um modelo multilíngue de reconhecimento de fala em streaming da NVIDIA, com 600 milhões de parâmetros. Faz parte da família aberta Nemotron, lançada com pesos, dados de treino e receitas abertos, e também disponível como microsserviços NVIDIA NIM.

Internamente, ele usa uma arquitetura Cache-Aware FastConformer-RNNT com condicionamento por prompt de identificação de idioma. Assim, um único checkpoint cobre cerca de 40 locais de idioma e gera diretamente pontuação e maiúsculas nativas.

O painel interativo no topo desta página permite experimentar agora mesmo o Nemotron AI para speech-to-text. A chamada passa pelo lado do servidor através do endpoint fal hospedado, para manter a chave de API privada, enquanto os pesos abertos continuam disponíveis no Hugging Face para auto-hospedagem.

Recursos

Por que o Nemotron 3.5 ASR se destaca

Reconhecimento em streaming, um checkpoint multilíngue compacto e latência ajustável em tempo de execução tornam o Nemotron um modelo speech-to-text prático.

Transcrição em streaming de baixa latência

O Nemotron 3.5 ASR foi feito para reconhecimento em streaming em tempo real. A NVIDIA informa um time-to-final abaixo de 100 ms em segmentos curtos — trate o número como um benchmark do fornecedor, mas a arquitetura mira claramente legendas ao vivo e agentes de voz.

Cache-Aware FastConformer-RNNT

O modelo combina um encoder FastConformer com reconhecimento de cache e um decoder RNNT, reaproveitando o contexto de streaming de forma eficiente em vez de reprocessar o áudio em buffer a cada passo.

Multilíngue em um único checkpoint

Um único checkpoint de 0,6B cobre cerca de 40 locais de idioma (aproximadamente 36 idiomas) com condicionamento por ID de idioma — sem precisar trocar de modelo para cada idioma.

Pontuação e maiúsculas nativas

As transcrições voltam já com pontuação e maiúsculas, de modo que o texto fica naturalmente legível sem uma etapa separada de restauração.

Latência configurável em tempo de execução

Alterne entre segmentos de cerca de 1,12 s, 0,56 s, 0,32 s e 0,08 s para equilibrar precisão e velocidade a cada requisição, sem precisar reimplantar.

Pegada compacta de 0,6B

Com 600 milhões de parâmetros, o modelo é pequeno o suficiente para servir com alta concorrência. A NVIDIA cita uma concorrência de GPU bem maior do que as abordagens em buffer; trate os números de throughput como dados do fornecedor.

Parte da família aberta Nemotron

O Nemotron é a família de modelos abertos da NVIDIA — lançada com pesos, dados de treino e receitas abertos, e disponível como microsserviços NVIDIA NIM para auto-hospedagem.

Do lado do servidor via API da fal

Esta página chama o endpoint fal atual do NVIDIA Nemotron ASR no lado do servidor, para que a sua FAL_KEY permaneça privada e o navegador receba apenas a transcrição.

Como usar

Transcreva com o Nemotron em quatro passos

Tudo acontece na demo acima — basta entrar com uma conta gratuita para começar. Cada execução custa 1 crédito.

1

Adicione o seu áudio

Envie um clipe curto (mp3, wav, ogg, m4a ou aac, até 10 MB) ou cole uma URL pública de áudio na demo do Nemotron no topo desta página.

2

Escolha idioma e aceleração

Deixe o idioma em detecção automática ou escolha um local compatível e, em seguida, selecione none, regular, high ou full conforme o equilíbrio entre precisão e latência desejado.

3

Execute a transcrição

Clique em Transcrever. A requisição é enviada ao nosso servidor, que chama o endpoint fal do Nemotron 3.5 ASR com a chave mantida privada e retorna o texto.

4

Copie ou refine o resultado

Leia a transcrição pontuada, copie-a e ajuste a aceleração ou a entrada se quiser comparar precisão e velocidade no mesmo clipe.

Latência vs. precisão

Escolher o nível de aceleração certo

A aceleração define o tamanho do segmento de streaming. Segmentos menores significam menor latência; segmentos maiores oferecem mais contexto e melhor precisão.

nonesegmentos de ~1,12 s

Melhor precisão. Ideal para transcrições finais, gravações e conteúdos que serão publicados.

regularsegmentos de ~0,56 s

Equilíbrio entre latência e precisão — a escolha padrão para a maioria dos clipes de demonstração.

highsegmentos de ~0,32 s

Respostas mais rápidas para uso interativo, com um compromisso de precisão mais perceptível.

fullsegmentos de ~0,08 s

Latência mínima para legendas ao vivo e agentes de voz; espere o maior compromisso de precisão.

Os tamanhos de segmento são aproximados e seguem as configurações documentadas pela NVIDIA. A fal exibe atualmente um preço de cerca de US$ 0,008 por minuto; consulte a documentação da API da fal para o esquema e os preços atuais.

Casos de uso

O que você pode criar com o Nemotron 3.5 ASR

O reconhecimento de fala multilíngue de baixa latência se encaixa em uma ampla variedade de produtos de áudio.

Legendas e captions ao vivo

Transmita a fala em legendas legíveis e pontuadas para reuniões, webinars e transmissões em que a latência importa.

Agentes de voz e assistentes

Alimente uma IA conversacional com transcrições de baixa latência para que os assistentes respondam enquanto o usuário ainda fala.

Transcrição multilíngue

Transcreva áudio em cerca de 40 locais de idioma a partir de um único modelo, sem precisar gerenciar checkpoints por idioma.

Análise de chamadas e reuniões

Transforme chamadas e reuniões em texto pesquisável e pontuado para pipelines de qualidade, conformidade e resumo.

Fluxos de mídia e podcasts

Crie rascunhos de transcrição para edição, notas de episódio e descoberta de trechos, e refine-os depois em um workspace de transcrição completo.

Ferramentas de acessibilidade

Ofereça speech-to-text em tempo real para acessibilidade, anotações e experiências de ditado.

Endpoint fal atual. Esta demo usa o nvidia/nemotron-asr-multilingual/asr para a transcrição Nemotron ASR hospedada. Erros do provedor, tempos limite ou problemas de configuração de conta são reembolsados na rota da demo. Os pesos do Nemotron 3.5 ASR são abertos no Hugging Face para auto-hospedagem; você também pode transcrever a qualquer momento no workspace Whisper AI .

FAQ

Perguntas frequentes sobre o Nemotron 3.5 ASR

Respostas às perguntas comuns sobre Nemotron, Nemotron AI e Nemotron 3.5 ASR.

O que é o Nemotron 3.5 ASR?

O Nemotron 3.5 ASR é o modelo aberto, multilíngue e de reconhecimento de fala em streaming da NVIDIA, com 0,6 bilhão de parâmetros. Ele transcreve áudio em texto em tempo real com uma arquitetura Cache-Aware FastConformer-RNNT, cobre cerca de 40 locais de idioma em um único checkpoint e gera diretamente pontuação e maiúsculas.

O que é o Nemotron?

O Nemotron é a família de modelos de IA abertos da NVIDIA, lançada com pesos, dados de treino e receitas abertos. A família abrange modelos de linguagem e de fala e é oferecida como microsserviços NVIDIA NIM. O Nemotron 3.5 ASR é o membro de reconhecimento de fala usado nesta página.

Posso experimentar o Nemotron AI gratuitamente aqui?

Você precisa de uma conta gratuita do Whisper AI para executar a demo, e cada transcrição custa 1 crédito. Contas novas recebem créditos iniciais gratuitos para experimentar o Nemotron imediatamente, e você pode recarregar a qualquer momento na página de preços.

Quantos idiomas o Nemotron 3.5 ASR suporta?

Um único checkpoint de 0,6B suporta cerca de 40 locais de idioma — aproximadamente 36 idiomas — usando condicionamento por prompt de identificação de idioma, então você não precisa de um modelo separado por idioma.

O que faz a configuração de aceleração?

A aceleração controla o tamanho do segmento de streaming e, portanto, o compromisso entre latência e precisão. none usa segmentos de cerca de 1,12 s para a melhor precisão; regular, high e full usam segmentos cada vez menores para reduzir a latência.

Quais formatos e tamanhos de áudio funcionam?

A fal documenta mp3, ogg, wav, m4a e aac para a entrada de arquivo, e um data URI é aceito. Esta demo limita os envios pelo navegador a cerca de 10 MB; para arquivos maiores, hospede-os e cole uma URL pública.

O meu áudio é privado?

A sua FAL_KEY nunca chega ao navegador — as requisições passam pelo nosso servidor. O áudio em si é enviado ao endpoint hospedado da NVIDIA na fal para processamento, então evite enviar gravações confidenciais para a demo pública.

Por que a demo às vezes diz que o endpoint está indisponível?

A demo depende do endpoint NVIDIA Nemotron ASR hospedado na fal, dos créditos da sua conta e da nossa configuração de FAL_KEY no lado do servidor. Se o provedor estiver indisponível ou uma requisição expirar, a demo direciona você ao workspace Whisper AI para continuar transcrevendo o seu áudio.

Experimente o speech-to-text do Nemotron AI

Envie um clipe, escolha um nível de aceleração e leia uma transcrição pontuada em segundos — depois explore os pesos abertos do Nemotron para construir o seu próprio pipeline.

Pesos abertos · 0,6 bi de parâmetros · ~40 locais de idioma