Modèle ouvert NVIDIA · reconnaissance vocale en streaming

Nemotron 3.5 ASR — Speech-to-Text NVIDIA en streaming

Essayez Nemotron AI pour convertir l’audio en texte dans votre navigateur

Nemotron est la famille de modèles ouverts de NVIDIA, et Nemotron 3.5 ASR en est le modèle de reconnaissance vocale multilingue en streaming avec 0,6 milliard de paramètres. Téléversez un extrait ou collez une URL audio ci-dessous pour obtenir en quelques secondes une transcription avec ponctuation.

0,6 Md de paramètres~40 locales linguistiquesFastConformer-RNNT sensible au cacheStreamingPonctuation et majuscules
Nemotron 3.5 ASR · démo en direct

Utilisez la détection automatique sauf si vous connaissez la langue principalement parlée.

Accélération

Une accélération plus forte utilise des segments de streaming plus courts pour réduire la latence ; none garde des segments de 1,12 s pour la meilleure précision, tandis que full utilise des segments de 0,08 s pour la latence la plus faible.

pour lancer la démo. Les nouveaux comptes reçoivent des crédits de démarrage gratuits ; chaque exécution coûte ensuite 1 crédit.

Attention : cette démo envoie l’audio à l’endpoint hébergé de NVIDIA Nemotron 3.5 ASR sur fal via notre serveur. Si le fournisseur est indisponible, votre audio peut être transcrit en sécurité dans le workspace Whisper AI.

Ce guide est indépendant. Nemotron et Nemotron 3.5 ASR sont des produits de NVIDIA; la démo passe par l’endpoint fal hébergé nvidia/nemotron-asr-multilingual/asr .

Aperçu

Qu’est-ce que Nemotron 3.5 ASR ?

Nemotron 3.5 ASR est un modèle de reconnaissance vocale multilingue en streaming de NVIDIA avec 600 millions de paramètres. Il fait partie de la famille ouverte Nemotron, publiée avec des poids, des données d’entraînement et des recettes ouverts, et disponible aussi sous forme de microservices NVIDIA NIM.

Sous le capot, il utilise une architecture Cache-Aware FastConformer-RNNT avec conditionnement par invite d’identification de langue. Un seul checkpoint couvre ainsi environ 40 locales linguistiques et produit directement la ponctuation et les majuscules natives.

Le panneau interactif en haut de cette page vous permet d’essayer dès maintenant Nemotron AI pour le speech-to-text. L’appel passe côté serveur par l’endpoint fal hébergé afin de garder la clé API privée, tandis que les poids ouverts restent disponibles sur Hugging Face pour l’auto-hébergement.

Fonctionnalités

Pourquoi Nemotron 3.5 ASR se distingue

Reconnaissance en streaming, checkpoint multilingue compact et latence réglable à l’exécution font de Nemotron un modèle speech-to-text pratique.

Transcription en streaming à faible latence

Nemotron 3.5 ASR est conçu pour la reconnaissance en streaming en temps réel. NVIDIA annonce un time-to-final inférieur à 100 ms sur de courts segments — considérez ce chiffre comme un benchmark fournisseur, mais l’architecture vise bien les sous-titres live et les agents vocaux.

Cache-Aware FastConformer-RNNT

Le modèle combine un encodeur FastConformer sensible au cache avec un décodeur RNNT, ce qui lui permet de réutiliser efficacement le contexte de streaming au lieu de retraiter l’audio mis en tampon à chaque étape.

Multilingue dans un seul checkpoint

Un unique checkpoint de 0,6B couvre environ 40 locales linguistiques (près de 36 langues) grâce au conditionnement par ID de langue — inutile de changer de modèle pour chaque langue.

Ponctuation et majuscules natives

Les transcriptions reviennent déjà ponctuées et capitalisées, ce qui rend le texte lisible naturellement sans étape séparée de restauration.

Latence configurable à l’exécution

Basculez entre des segments d’environ 1,12 s, 0,56 s, 0,32 s et 0,08 s pour équilibrer précision et vitesse à chaque requête, sans redéploiement.

Empreinte compacte de 0,6B

Avec 600 millions de paramètres, le modèle est assez compact pour une forte concurrence de service. NVIDIA cite une concurrence GPU nettement supérieure aux approches tamponnées ; traitez ces chiffres de débit comme des données fournisseur.

Membre de la famille ouverte Nemotron

Nemotron est la famille de modèles ouverts de NVIDIA — publiée avec des poids, données d’entraînement et recettes ouverts, et disponible comme microservices NVIDIA NIM pour l’auto-hébergement.

Côté serveur via l’API fal

Cette page appelle côté serveur l’endpoint fal actuel de NVIDIA Nemotron ASR afin que votre FAL_KEY reste privée et que le navigateur ne reçoive que la transcription.

Mode d’emploi

Transcrire avec Nemotron en quatre étapes

Tout se passe dans la démo ci-dessus : connectez-vous simplement avec un compte gratuit pour commencer. Chaque exécution coûte 1 crédit.

1

Ajouter votre audio

Téléversez un court extrait (mp3, wav, ogg, m4a ou aac, jusqu’à 10 Mo) ou collez une URL audio publique dans la démo Nemotron en haut de la page.

2

Choisir la langue et l’accélération

Laissez la langue en détection automatique ou choisissez une locale prise en charge, puis sélectionnez none, regular, high ou full selon le compromis précision-latence souhaité.

3

Lancer la transcription

Cliquez sur Transcrire. La requête est envoyée à notre serveur, qui appelle l’endpoint fal Nemotron 3.5 ASR avec une clé gardée privée, puis renvoie le texte.

4

Copier ou affiner le résultat

Lisez la transcription ponctuée, copiez-la et ajustez l’accélération ou l’entrée si vous voulez comparer précision et vitesse sur le même extrait.

Latence vs précision

Choisir le bon niveau d’accélération

L’accélération règle la taille des segments de streaming. Des segments plus courts réduisent la latence ; des segments plus longs donnent davantage de contexte et améliorent la précision.

nonesegments de ~1,12 s

Meilleure précision. À privilégier pour les transcriptions finales, les enregistrements et les contenus à publier.

regularsegments de ~0,56 s

Équilibre entre latence et précision — le choix par défaut pour la plupart des extraits de démonstration.

highsegments de ~0,32 s

Réponses plus rapides pour les usages interactifs, avec un compromis de précision plus visible.

fullsegments de ~0,08 s

Latence minimale pour les sous-titres live et les agents vocaux ; attendez-vous au compromis de précision le plus important.

Les tailles de segments sont approximatives et suivent les configurations documentées par NVIDIA. fal affiche actuellement un tarif autour de 0,008 $ par minute ; consultez la documentation de l’API fal pour le schéma et les tarifs à jour.

Cas d’usage

Ce que vous pouvez créer avec Nemotron 3.5 ASR

La reconnaissance vocale multilingue à faible latence convient à de nombreux produits audio.

Sous-titres et captions en direct

Diffusez la parole en sous-titres lisibles et ponctués pour des réunions, webinaires et émissions où la latence compte.

Agents vocaux et assistants

Alimentez une IA conversationnelle avec des transcriptions à faible latence pour que les assistants puissent répondre pendant que l’utilisateur parle encore.

Transcription multilingue

Transcrivez de l’audio dans environ 40 locales linguistiques depuis un seul modèle, sans jongler avec des checkpoints par langue.

Analyse d’appels et de réunions

Transformez appels et réunions en texte consultable pour la qualité, la conformité et les pipelines de résumé.

Workflows médias et podcasts

Créez des brouillons de transcription pour le montage, les notes d’épisode et la recherche d’extraits, puis affinez-les dans un workspace de transcription complet.

Outils d’accessibilité

Fournissez du speech-to-text en temps réel pour l’accessibilité, la prise de notes et les expériences de dictée.

Endpoint fal actuel. Cette démo utilise le nvidia/nemotron-asr-multilingual/asr pour la transcription Nemotron ASR hébergée. Les erreurs fournisseur, délais d’attente ou problèmes de configuration de compte sont remboursés dans la route de démo. Les poids de Nemotron 3.5 ASR sont ouverts sur Hugging Face pour l’auto-hébergement ; vous pouvez aussi transcrire dans le workspace Whisper AI .

FAQ

Questions fréquentes sur Nemotron 3.5 ASR

Réponses aux questions courantes sur Nemotron, Nemotron AI et Nemotron 3.5 ASR.

Qu’est-ce que Nemotron 3.5 ASR ?

Nemotron 3.5 ASR est le modèle ouvert de reconnaissance vocale multilingue en streaming de NVIDIA, avec 0,6 milliard de paramètres. Il transcrit l’audio en texte en temps réel avec une architecture Cache-Aware FastConformer-RNNT, couvre environ 40 locales linguistiques dans un seul checkpoint et produit directement ponctuation et majuscules.

Qu’est-ce que Nemotron ?

Nemotron est la famille de modèles IA ouverts de NVIDIA, publiée avec des poids, des données d’entraînement et des recettes ouverts. La famille couvre des modèles de langage et de parole et est proposée comme microservices NVIDIA NIM. Nemotron 3.5 ASR est le membre de reconnaissance vocale utilisé sur cette page.

Puis-je essayer Nemotron AI gratuitement ici ?

Vous avez besoin d’un compte Whisper AI gratuit pour lancer la démo, et chaque transcription coûte 1 crédit. Les nouveaux comptes reçoivent des crédits de démarrage gratuits pour essayer Nemotron immédiatement, puis vous pouvez recharger à tout moment sur la page des tarifs.

Combien de langues Nemotron 3.5 ASR prend-il en charge ?

Un seul checkpoint de 0,6B prend en charge environ 40 locales linguistiques — près de 36 langues — grâce au conditionnement par invite d’identification de langue. Vous n’avez donc pas besoin d’un modèle distinct par langue.

À quoi sert le réglage d’accélération ?

L’accélération contrôle la taille des segments de streaming et donc le compromis latence/précision. none utilise des segments d’environ 1,12 s pour la meilleure précision ; regular, high et full utilisent des segments de plus en plus courts pour réduire la latence.

Quels formats et tailles audio fonctionnent ?

fal documente les formats mp3, ogg, wav, m4a et aac pour l’entrée fichier, et les Data URI sont acceptées. Cette démo limite les téléversements navigateur à environ 10 Mo ; pour les fichiers plus longs, hébergez-les et collez une URL publique.

Mon audio reste-t-il privé ?

Votre FAL_KEY n’atteint jamais le navigateur : les requêtes passent par notre serveur. L’audio lui-même est envoyé à l’endpoint NVIDIA hébergé sur fal pour traitement ; évitez donc de téléverser des enregistrements confidentiels dans la démo publique.

Pourquoi la démo indique-t-elle parfois que l’endpoint est indisponible ?

La démo dépend de l’endpoint NVIDIA Nemotron ASR hébergé sur fal, de vos crédits de compte et de notre configuration FAL_KEY côté serveur. Si le fournisseur est indisponible ou qu’une requête expire, la démo vous oriente vers le workspace Whisper AI pour continuer à faire transcrire votre audio.

Essayez le speech-to-text Nemotron AI

Téléversez un extrait, choisissez un niveau d’accélération et lisez une transcription ponctuée en quelques secondes — puis explorez les poids ouverts de Nemotron pour construire votre propre pipeline.

Poids ouverts · 0,6 Md de paramètres · ~40 locales linguistiques