Modello aperto NVIDIA · riconoscimento vocale in streaming

Nemotron 3.5 ASR — Speech-to-Text NVIDIA in streaming

Prova Nemotron AI per convertire audio in testo nel tuo browser

Nemotron è la famiglia di modelli aperti di NVIDIA, e Nemotron 3.5 ASR è il suo modello multilingue di riconoscimento vocale in streaming da 0,6 miliardi di parametri. Carica un clip o incolla qui sotto un URL audio per ottenere in pochi secondi una trascrizione con punteggiatura.

0,6 mld di parametri~40 varianti lingua-localeCache-Aware FastConformer-RNNTStreamingPunteggiatura e maiuscole
Nemotron 3.5 ASR · demo dal vivo

Usa il rilevamento automatico a meno che tu conosca la lingua parlata principale.

Accelerazione

Un’accelerazione maggiore usa segmenti di streaming più piccoli per ridurre la latenza; none mantiene segmenti da 1,12 s per la migliore accuratezza, mentre full usa segmenti da 0,08 s per la latenza più bassa.

per eseguire la demo. I nuovi account ricevono crediti iniziali gratuiti; poi ogni esecuzione costa 1 credito.

Nota: questa demo invia l’audio all’endpoint ospitato di NVIDIA Nemotron 3.5 ASR su fal tramite il nostro server. Se il provider non è disponibile, il tuo audio può essere trascritto in sicurezza nel workspace Whisper AI.

Questa è una guida indipendente. Nemotron e Nemotron 3.5 ASR sono prodotti di NVIDIA; la demo viene eseguita tramite l’endpoint fal ospitato nvidia/nemotron-asr-multilingual/asr .

Panoramica

Che cos’è Nemotron 3.5 ASR?

Nemotron 3.5 ASR è un modello NVIDIA multilingue di riconoscimento vocale in streaming con 600 milioni di parametri. È il membro speech della famiglia aperta Nemotron, rilasciata con pesi, dati di training e ricette aperti, e disponibile anche come microservizi NVIDIA NIM.

Sotto il cofano usa un’architettura Cache-Aware FastConformer-RNNT con condizionamento tramite prompt di identificazione lingua: un singolo checkpoint gestisce circa 40 varianti lingua-locale e restituisce punteggiatura e maiuscole native.

Il pannello interattivo in alto in questa pagina ti permette di provare subito Nemotron AI per lo speech-to-text. La chiamata passa lato server attraverso l’endpoint fal ospitato, così la chiave API resta privata mentre i pesi aperti rimangono disponibili su Hugging Face per l’auto-hosting.

Funzionalità

Perché Nemotron 3.5 ASR si distingue

Riconoscimento in streaming, un checkpoint multilingue compatto e latenza regolabile a runtime rendono Nemotron un modello speech-to-text pratico.

Riconoscimento vocale in streaming

Nemotron 3.5 ASR è progettato per il riconoscimento in streaming in tempo reale. NVIDIA indica un time-to-final sotto i 100 ms su segmenti brevi: considera il dato un benchmark del fornitore, ma l’architettura punta chiaramente a sottotitoli live e agenti vocali.

Cache-Aware FastConformer-RNNT

Il modello combina un encoder FastConformer sensibile alla cache con un decoder RNNT, riutilizzando il contesto di streaming in modo efficiente invece di rielaborare l’audio bufferizzato a ogni passaggio.

Multilingue in un unico checkpoint

Un singolo checkpoint da 0,6B copre circa 40 varianti lingua-locale (circa 36 lingue) con condizionamento tramite ID lingua: non serve cambiare modello per ogni lingua.

Punteggiatura e maiuscole native

Le trascrizioni tornano già con punteggiatura e maiuscole, quindi il testo risulta naturale senza un passaggio separato di ripristino.

Latenza configurabile a runtime

Passa tra segmenti di circa 1,12 s, 0,56 s, 0,32 s e 0,08 s per bilanciare accuratezza e velocità a ogni richiesta, senza ridistribuire il servizio.

Ingombro compatto da 0,6B

Con 600 milioni di parametri, il modello è abbastanza compatto da servire alta concorrenza. NVIDIA cita una concorrenza GPU molto superiore agli approcci bufferizzati; tratta i dati di throughput come numeri del fornitore.

Parte della famiglia aperta Nemotron

Nemotron è la famiglia di modelli aperti di NVIDIA: rilasciata con pesi, dati di training e ricette aperti, e disponibile come microservizi NVIDIA NIM per l’auto-hosting.

Lato server tramite API fal

Questa pagina chiama lato server l’endpoint fal attuale di NVIDIA Nemotron ASR, così la tua FAL_KEY resta privata e il browser riceve solo la trascrizione.

Come usarlo

Trascrivi con Nemotron in quattro passaggi

Tutto avviene nella demo qui sopra: accedi con un account gratuito per iniziare. Ogni esecuzione costa 1 credito.

1

Aggiungi il tuo audio

Carica un breve clip (mp3, wav, ogg, m4a o aac, fino a 10 MB) oppure incolla un URL audio pubblico nella demo Nemotron in alto nella pagina.

2

Scegli lingua e accelerazione

Lascia la lingua su rilevamento automatico o scegli una locale supportata, poi seleziona none, regular, high o full in base al compromesso accuratezza-latenza che preferisci.

3

Esegui la trascrizione

Premi Trascrivi. La richiesta viene inviata al nostro server, che chiama l’endpoint fal Nemotron 3.5 ASR mantenendo privata la chiave e poi restituisce il testo.

4

Copia o perfeziona il risultato

Leggi la trascrizione con punteggiatura, copiala e modifica accelerazione o input se vuoi confrontare accuratezza e velocità sullo stesso clip.

Latenza vs accuratezza

Scegliere il livello di accelerazione giusto

L’accelerazione definisce la dimensione dei segmenti di streaming. Segmenti più piccoli riducono la latenza; segmenti più grandi offrono più contesto e migliore accuratezza.

nonesegmenti da ~1,12 s

Massima accuratezza. Ideale per trascrizioni finali, registrazioni e contenuti da pubblicare.

regularsegmenti da ~0,56 s

Equilibrio tra latenza e accuratezza: la scelta predefinita per la maggior parte dei clip demo.

highsegmenti da ~0,32 s

Risposte più rapide per l’uso interattivo, con un compromesso di accuratezza più evidente.

fullsegmenti da ~0,08 s

Latenza minima per sottotitoli live e agenti vocali; aspettati il compromesso di accuratezza più ampio.

Le dimensioni dei segmenti sono approssimative e seguono le configurazioni documentate da NVIDIA. fal al momento indica prezzi intorno a 0,008 $ al minuto; consulta la documentazione API di fal per schema e tariffe aggiornati.

Casi d’uso

Cosa puoi creare con Nemotron 3.5 ASR

Il riconoscimento vocale multilingue a bassa latenza si adatta a molti prodotti audio.

Sottotitoli e captions dal vivo

Trasforma lo speech in sottotitoli leggibili e con punteggiatura per riunioni, webinar e trasmissioni in cui la latenza conta.

Agenti vocali e assistenti

Fornisci trascrizioni a bassa latenza all’IA conversazionale, così gli assistenti possono rispondere mentre l’utente sta ancora parlando.

Trascrizione multilingue

Trascrivi audio in circa 40 varianti lingua-locale da un unico modello, senza gestire checkpoint specifici per lingua.

Analisi di chiamate e riunioni

Trasforma chiamate e riunioni in testo ricercabile e con punteggiatura per pipeline di QA, compliance e riepilogo.

Workflow media e podcast

Crea bozze di trascrizione per editing, note episodio e scoperta di clip, poi perfezionale in un workspace completo di trascrizione.

Strumenti di accessibilità

Offri speech-to-text in tempo reale per accessibilità, appunti ed esperienze di dettatura.

Endpoint fal attuale. Questa demo usa l’endpoint nvidia/nemotron-asr-multilingual/asr per la trascrizione Nemotron ASR ospitata. Errori del provider, timeout o problemi di configurazione dell’account vengono rimborsati nella route della demo. I pesi di Nemotron 3.5 ASR sono aperti su Hugging Face per l’auto-hosting; puoi anche trascrivere in qualsiasi momento nel workspace Whisper AI .

FAQ

Domande frequenti su Nemotron 3.5 ASR

Risposte alle domande comuni su Nemotron, Nemotron AI e Nemotron 3.5 ASR.

Che cos’è Nemotron 3.5 ASR?

Nemotron 3.5 ASR è il modello NVIDIA aperto, multilingue e di riconoscimento vocale in streaming (ASR) da 0,6 miliardi di parametri. Trascrive audio in testo in tempo reale con un’architettura Cache-Aware FastConformer-RNNT, copre circa 40 varianti lingua-locale in un singolo checkpoint e produce direttamente punteggiatura e maiuscole native.

Che cos’è Nemotron?

Nemotron è la famiglia di modelli IA aperti di NVIDIA, rilasciata con pesi, dati di training e ricette aperti. La famiglia include modelli linguistici e speech ed è distribuita come microservizi NVIDIA NIM. Nemotron 3.5 ASR è il membro di riconoscimento vocale usato in questa pagina.

Posso provare Nemotron AI gratis qui?

Serve un account Whisper AI gratuito per eseguire la demo e ogni trascrizione costa 1 credito. I nuovi account includono crediti iniziali gratuiti per provare subito Nemotron, e puoi ricaricare in qualsiasi momento dalla pagina prezzi.

Quante lingue supporta Nemotron 3.5 ASR?

Un singolo checkpoint da 0,6B supporta circa 40 varianti lingua-locale, cioè circa 36 lingue, usando il condizionamento tramite prompt di identificazione lingua; non serve quindi un modello separato per ogni lingua.

A cosa serve l’impostazione di accelerazione?

L’accelerazione controlla la dimensione dei segmenti di streaming e quindi il compromesso latenza/accuratezza. none usa segmenti da circa 1,12 s per la migliore accuratezza; regular, high e full usano segmenti via via più piccoli per ridurre la latenza.

Quali formati e dimensioni audio funzionano?

fal documenta mp3, ogg, wav, m4a e aac per l’input file, e accetta anche data URI. Questa demo limita i caricamenti dal browser a circa 10 MB; per file più lunghi, ospitali e incolla un URL pubblico.

Il mio audio è privato?

La tua FAL_KEY non arriva mai al browser: le richieste passano dal nostro server. L’audio stesso viene inviato all’endpoint NVIDIA ospitato su fal per l’elaborazione, quindi evita di caricare registrazioni riservate nella demo pubblica.

Perché a volte la demo dice che l’endpoint non è disponibile?

La demo dipende dall’endpoint NVIDIA Nemotron ASR ospitato su fal, dai crediti del tuo account e dalla nostra configurazione FAL_KEY lato server. Se il provider non è disponibile o una richiesta scade, la demo ti indirizza al workspace Whisper AI per continuare a trascrivere il tuo audio.

Prova lo speech-to-text Nemotron AI

Carica un clip, scegli un livello di accelerazione e leggi in pochi secondi una trascrizione con punteggiatura; poi esplora i pesi aperti di Nemotron per costruire la tua pipeline.

Pesi aperti · 0,6 mld di parametri · ~40 varianti lingua-locale