Nemotron 3.5 ASR — Speech-to-Text NVIDIA in streaming
Prova Nemotron AI per convertire audio in testo nel tuo browser
Nemotron è la famiglia di modelli aperti di NVIDIA, e Nemotron 3.5 ASR è il suo modello multilingue di riconoscimento vocale in streaming da 0,6 miliardi di parametri. Carica un clip o incolla qui sotto un URL audio per ottenere in pochi secondi una trascrizione con punteggiatura.
Usa il rilevamento automatico a meno che tu conosca la lingua parlata principale.
Un’accelerazione maggiore usa segmenti di streaming più piccoli per ridurre la latenza; none mantiene segmenti da 1,12 s per la migliore accuratezza, mentre full usa segmenti da 0,08 s per la latenza più bassa.
per eseguire la demo. I nuovi account ricevono crediti iniziali gratuiti; poi ogni esecuzione costa 1 credito.
Nota: questa demo invia l’audio all’endpoint ospitato di NVIDIA Nemotron 3.5 ASR su fal tramite il nostro server. Se il provider non è disponibile, il tuo audio può essere trascritto in sicurezza nel workspace Whisper AI.
Questa è una guida indipendente. Nemotron e Nemotron 3.5 ASR sono prodotti di NVIDIA; la demo viene eseguita tramite l’endpoint fal ospitato nvidia/nemotron-asr-multilingual/asr .
Che cos’è Nemotron 3.5 ASR?
Nemotron 3.5 ASR è un modello NVIDIA multilingue di riconoscimento vocale in streaming con 600 milioni di parametri. È il membro speech della famiglia aperta Nemotron, rilasciata con pesi, dati di training e ricette aperti, e disponibile anche come microservizi NVIDIA NIM.
Sotto il cofano usa un’architettura Cache-Aware FastConformer-RNNT con condizionamento tramite prompt di identificazione lingua: un singolo checkpoint gestisce circa 40 varianti lingua-locale e restituisce punteggiatura e maiuscole native.
Il pannello interattivo in alto in questa pagina ti permette di provare subito Nemotron AI per lo speech-to-text. La chiamata passa lato server attraverso l’endpoint fal ospitato, così la chiave API resta privata mentre i pesi aperti rimangono disponibili su Hugging Face per l’auto-hosting.
Perché Nemotron 3.5 ASR si distingue
Riconoscimento in streaming, un checkpoint multilingue compatto e latenza regolabile a runtime rendono Nemotron un modello speech-to-text pratico.
Riconoscimento vocale in streaming
Nemotron 3.5 ASR è progettato per il riconoscimento in streaming in tempo reale. NVIDIA indica un time-to-final sotto i 100 ms su segmenti brevi: considera il dato un benchmark del fornitore, ma l’architettura punta chiaramente a sottotitoli live e agenti vocali.
Cache-Aware FastConformer-RNNT
Il modello combina un encoder FastConformer sensibile alla cache con un decoder RNNT, riutilizzando il contesto di streaming in modo efficiente invece di rielaborare l’audio bufferizzato a ogni passaggio.
Multilingue in un unico checkpoint
Un singolo checkpoint da 0,6B copre circa 40 varianti lingua-locale (circa 36 lingue) con condizionamento tramite ID lingua: non serve cambiare modello per ogni lingua.
Punteggiatura e maiuscole native
Le trascrizioni tornano già con punteggiatura e maiuscole, quindi il testo risulta naturale senza un passaggio separato di ripristino.
Latenza configurabile a runtime
Passa tra segmenti di circa 1,12 s, 0,56 s, 0,32 s e 0,08 s per bilanciare accuratezza e velocità a ogni richiesta, senza ridistribuire il servizio.
Ingombro compatto da 0,6B
Con 600 milioni di parametri, il modello è abbastanza compatto da servire alta concorrenza. NVIDIA cita una concorrenza GPU molto superiore agli approcci bufferizzati; tratta i dati di throughput come numeri del fornitore.
Parte della famiglia aperta Nemotron
Nemotron è la famiglia di modelli aperti di NVIDIA: rilasciata con pesi, dati di training e ricette aperti, e disponibile come microservizi NVIDIA NIM per l’auto-hosting.
Lato server tramite API fal
Questa pagina chiama lato server l’endpoint fal attuale di NVIDIA Nemotron ASR, così la tua FAL_KEY resta privata e il browser riceve solo la trascrizione.
Trascrivi con Nemotron in quattro passaggi
Tutto avviene nella demo qui sopra: accedi con un account gratuito per iniziare. Ogni esecuzione costa 1 credito.
Aggiungi il tuo audio
Carica un breve clip (mp3, wav, ogg, m4a o aac, fino a 10 MB) oppure incolla un URL audio pubblico nella demo Nemotron in alto nella pagina.
Scegli lingua e accelerazione
Lascia la lingua su rilevamento automatico o scegli una locale supportata, poi seleziona none, regular, high o full in base al compromesso accuratezza-latenza che preferisci.
Esegui la trascrizione
Premi Trascrivi. La richiesta viene inviata al nostro server, che chiama l’endpoint fal Nemotron 3.5 ASR mantenendo privata la chiave e poi restituisce il testo.
Copia o perfeziona il risultato
Leggi la trascrizione con punteggiatura, copiala e modifica accelerazione o input se vuoi confrontare accuratezza e velocità sullo stesso clip.
Scegliere il livello di accelerazione giusto
L’accelerazione definisce la dimensione dei segmenti di streaming. Segmenti più piccoli riducono la latenza; segmenti più grandi offrono più contesto e migliore accuratezza.
Massima accuratezza. Ideale per trascrizioni finali, registrazioni e contenuti da pubblicare.
Equilibrio tra latenza e accuratezza: la scelta predefinita per la maggior parte dei clip demo.
Risposte più rapide per l’uso interattivo, con un compromesso di accuratezza più evidente.
Latenza minima per sottotitoli live e agenti vocali; aspettati il compromesso di accuratezza più ampio.
Le dimensioni dei segmenti sono approssimative e seguono le configurazioni documentate da NVIDIA. fal al momento indica prezzi intorno a 0,008 $ al minuto; consulta la documentazione API di fal per schema e tariffe aggiornati.
Cosa puoi creare con Nemotron 3.5 ASR
Il riconoscimento vocale multilingue a bassa latenza si adatta a molti prodotti audio.
Sottotitoli e captions dal vivo
Trasforma lo speech in sottotitoli leggibili e con punteggiatura per riunioni, webinar e trasmissioni in cui la latenza conta.
Agenti vocali e assistenti
Fornisci trascrizioni a bassa latenza all’IA conversazionale, così gli assistenti possono rispondere mentre l’utente sta ancora parlando.
Trascrizione multilingue
Trascrivi audio in circa 40 varianti lingua-locale da un unico modello, senza gestire checkpoint specifici per lingua.
Analisi di chiamate e riunioni
Trasforma chiamate e riunioni in testo ricercabile e con punteggiatura per pipeline di QA, compliance e riepilogo.
Workflow media e podcast
Crea bozze di trascrizione per editing, note episodio e scoperta di clip, poi perfezionale in un workspace completo di trascrizione.
Strumenti di accessibilità
Offri speech-to-text in tempo reale per accessibilità, appunti ed esperienze di dettatura.
Endpoint fal attuale. Questa demo usa l’endpoint nvidia/nemotron-asr-multilingual/asr per la trascrizione Nemotron ASR ospitata. Errori del provider, timeout o problemi di configurazione dell’account vengono rimborsati nella route della demo. I pesi di Nemotron 3.5 ASR sono aperti su Hugging Face per l’auto-hosting; puoi anche trascrivere in qualsiasi momento nel workspace Whisper AI .
Domande frequenti su Nemotron 3.5 ASR
Risposte alle domande comuni su Nemotron, Nemotron AI e Nemotron 3.5 ASR.
Che cos’è Nemotron 3.5 ASR?
Nemotron 3.5 ASR è il modello NVIDIA aperto, multilingue e di riconoscimento vocale in streaming (ASR) da 0,6 miliardi di parametri. Trascrive audio in testo in tempo reale con un’architettura Cache-Aware FastConformer-RNNT, copre circa 40 varianti lingua-locale in un singolo checkpoint e produce direttamente punteggiatura e maiuscole native.
Che cos’è Nemotron?
Nemotron è la famiglia di modelli IA aperti di NVIDIA, rilasciata con pesi, dati di training e ricette aperti. La famiglia include modelli linguistici e speech ed è distribuita come microservizi NVIDIA NIM. Nemotron 3.5 ASR è il membro di riconoscimento vocale usato in questa pagina.
Posso provare Nemotron AI gratis qui?
Serve un account Whisper AI gratuito per eseguire la demo e ogni trascrizione costa 1 credito. I nuovi account includono crediti iniziali gratuiti per provare subito Nemotron, e puoi ricaricare in qualsiasi momento dalla pagina prezzi.
Quante lingue supporta Nemotron 3.5 ASR?
Un singolo checkpoint da 0,6B supporta circa 40 varianti lingua-locale, cioè circa 36 lingue, usando il condizionamento tramite prompt di identificazione lingua; non serve quindi un modello separato per ogni lingua.
A cosa serve l’impostazione di accelerazione?
L’accelerazione controlla la dimensione dei segmenti di streaming e quindi il compromesso latenza/accuratezza. none usa segmenti da circa 1,12 s per la migliore accuratezza; regular, high e full usano segmenti via via più piccoli per ridurre la latenza.
Quali formati e dimensioni audio funzionano?
fal documenta mp3, ogg, wav, m4a e aac per l’input file, e accetta anche data URI. Questa demo limita i caricamenti dal browser a circa 10 MB; per file più lunghi, ospitali e incolla un URL pubblico.
Il mio audio è privato?
La tua FAL_KEY non arriva mai al browser: le richieste passano dal nostro server. L’audio stesso viene inviato all’endpoint NVIDIA ospitato su fal per l’elaborazione, quindi evita di caricare registrazioni riservate nella demo pubblica.
Perché a volte la demo dice che l’endpoint non è disponibile?
La demo dipende dall’endpoint NVIDIA Nemotron ASR ospitato su fal, dai crediti del tuo account e dalla nostra configurazione FAL_KEY lato server. Se il provider non è disponibile o una richiesta scade, la demo ti indirizza al workspace Whisper AI per continuare a trascrivere il tuo audio.
Prova lo speech-to-text Nemotron AI
Carica un clip, scegli un livello di accelerazione e leggi in pochi secondi una trascrizione con punteggiatura; poi esplora i pesi aperti di Nemotron per costruire la tua pipeline.
Pesi aperti · 0,6 mld di parametri · ~40 varianti lingua-locale
