NVIDIA open model · streaming spraakherkenning

Nemotron 3.5 ASR — NVIDIA-streaming spraak naar tekst

Probeer Nemotron AI audio-naar-tekst live in uw browser

Nemotron is de familie van open modellen van NVIDIA, en Nemotron 3.5 ASR is het 0.6B meertalige streaming-spraakherkenningsmodel. Upload een clip of plak hieronder een audio-URL en ontvang binnen enkele seconden een transcriptie met leestekens.

0,6 miljard parameters~40 taalvariantenCache-Aware FastConformer-RNNTStreamenInterpunctie en hoofdlettergebruik
Nemotron 3.5 ASR · livedemo

Gebruik automatische detectie, tenzij u de belangrijkste gesproken taal kent.

Acceleratie

Hogere acceleratie maakt gebruik van kleinere streaming-brokken voor een lagere latentie; geen houdt brokken van 1,12 seconde vast voor de beste nauwkeurigheid, terwijl vol gebruikt chunks van 0,08s voor de laagste latentie.

om de demo uit te voeren. Nieuwe accounts krijgen gratis startcredits; elke run kost dan 1 krediet.

Let op: deze demo stuurt audio naar de gehoste NVIDIA Nemotron 3.5 ASR eindpunt op fal via onze server. Als de provider niet beschikbaar is, kan uw audio veilig worden getranscribeerd in de Whisper AI-werkruimte.

Dit is een onafhankelijke gids. Nemotron en Nemotron 3.5 ASR zijn producten van NVIDIA; de demo loopt via de gehoste fal nvidia/nemotron-asr-multilingual/asr eindpunt.

Overzicht

Wat is Nemotron 3.5 ASR?

Nemotron 3.5 ASR is een meertalig streaming-spraakherkenningsmodel met 600 miljoen parameters van NVIDIA. Het is het spraaklid van de Nemotron-familie van open modellen - uitgebracht met open gewichten, trainingsgegevens en recepten, en beschikbaar als NVIDIA NIM-microservices.

Onder de motorkap gebruikt het een Cache-Aware FastConformer-RNNT-architectuur met taal-ID-promptconditionering. Daardoor verwerkt één checkpoint ongeveer 40 taalvarianten en levert het model zelf leestekens en hoofdlettergebruik.

Via het interactieve paneel bovenaan deze pagina kunt u Nemotron AI spraak-naar-tekst nu meteen uitproberen. Het roept het gehoste fal-eindpunt aan vanaf onze server, zodat de API-sleutel privé blijft terwijl de open gewichten beschikbaar blijven op Hugging Face voor zelfhosting.

Functies

Waarom Nemotron 3.5 ASR opvalt

Streamingherkenning, een compact meertalig checkpoint en tijdens runtime instelbare latentie maken Nemotron tot een praktisch spraak-naar-tekstmodel.

Streaming, transcriptie met lage latentie

Nemotron 3.5 ASR is gebouwd voor realtime streamingherkenning. NVIDIA rapporteert een tijd tot de finale van minder dan 100 ms voor korte stukjes. Beschouw het cijfer als een benchmark voor leveranciers, maar het ontwerp is gericht op live ondertiteling en stemagenten.

Cache-Aware FastConformer-RNNT

Het model maakt gebruik van een Cache-Aware FastConformer-encoder met een RNNT-decoder, zodat de streamingcontext efficiënt wordt hergebruikt in plaats van dat de gebufferde audio bij elke stap opnieuw moet worden verwerkt.

Meertalig met één checkpoint

Eén checkpoint met 0,6 miljard parameters bestrijkt ongeveer 40 taalvarianten (circa 36 talen) met taal-ID-promptconditionering. U hoeft dus niet per taal van model te wisselen.

Eigen interpunctie en hoofdlettergebruik

Afschriften komen terug met ingebouwde interpunctie en hoofdlettergebruik, zodat de uitvoer op natuurlijke wijze leest zonder een afzonderlijke herstelpas.

Runtime-configureerbare latentie

Schakel tussen chunkgroottes (ongeveer 1,12s, 0,56s, 0,32s en 0,08s) om nauwkeurigheid in te ruilen voor snelheid op het moment van verzoek via de acceleratie-instelling, zonder dat opnieuw inzetten nodig is.

Compacte 0.6B-voetafdruk

Bij 600M-parameters is het model klein genoeg om met hoge gelijktijdigheid te werken. NVIDIA noemt een aanzienlijk hogere GPU-concurrency dan gebufferde benaderingen; behandel doorvoerclaims als leveranciersnummers.

Onderdeel van de open Nemotron-familie

Nemotron is de familie van open modellen van NVIDIA - uitgebracht met open gewichten, trainingsgegevens en recepten, en beschikbaar als NVIDIA NIM microservices voor zelfhosting.

Serverzijde via de fal API

Deze pagina roept de huidige NVIDIA Nemotron ASR fal-eindpuntserver aan, zodat uw FAL_KEY privé blijft en browsergebruikers alleen het transcript ontvangen.

Hoe te gebruiken

Transcribeer met Nemotron in vier stappen

Alles gebeurt in de bovenstaande demo. Meld u gewoon aan met een gratis account om te beginnen. Elke run kost 1 credit.

1

Voeg uw audio toe

Upload een korte clip (mp3, wav, ogg, m4a of aac, maximaal 10 MB) of plak een openbare audio-URL in de Nemotron-demo bovenaan deze pagina.

2

Kies taal en versnelling

Laat de taal op automatische detectie staan ​​of kies een ondersteunde landinstelling en kies vervolgens geen, normale, hoge of volledige versnelling, afhankelijk van de gewenste afweging tussen nauwkeurigheid en latentie.

3

Voer de transcriptie uit

Druk op Transcriberen. Het verzoek wordt naar onze server verzonden, die het fal Nemotron 3.5 ASR-eindpunt aanroept, waarbij uw sleutel privé wordt gehouden, en vervolgens de tekst retourneert.

4

Kopieer of verfijn het resultaat

Lees het transcript met leestekens, kopieer het en pas de versnelling of invoer aan als u nauwkeurigheid versus snelheid op dezelfde clip wilt vergelijken.

Latentie versus nauwkeurigheid

Een versnellingsniveau kiezen

Versnelling stelt de grootte van het streamingfragment in. Kleinere stukjes betekenen een lagere latentie; grotere stukken betekenen meer context en betere nauwkeurigheid.

geen~1,12s-brokken

Beste nauwkeurigheid. Gebruik het voor definitieve transcripties, opnames en alles wat u publiceert.

regelmatig~0,56s-brokken

Evenwichtige latentie en nauwkeurigheid: de standaardkeuze voor de meeste democlips.

hoog~0,32s-brokken

Snellere reacties voor interactief gebruik, met een duidelijkere nauwkeurigheidsafweging.

vol~0,08s-brokken

Laagste latentie voor live ondertiteling en stemagenten; verwacht de grootste nauwkeurigheidsafweging.

De chunkgroottes zijn bij benadering en volgen de gedocumenteerde configuraties van NVIDIA. fal toont momenteel prijzen van ongeveer $ 0,008 per minuut; bekijk de API-documenten van fal voor het huidige schema en de tarieven.

Gebruiksgevallen

Wat u kunt bouwen met Nemotron 3.5 ASR

Meertalige spraakherkenning met lage latentie is geschikt voor een breed scala aan audioproducten.

Live ondertiteling en ondertiteling

Stream spraak naar leesbare, onderbroken ondertiteling voor vergaderingen, webinars en uitzendingen waarbij latentie van belang is.

Spraakagenten en assistenten

Voer transcripties met lage latentie in conversatie-AI in, zodat assistenten kunnen reageren terwijl de gebruiker nog aan het woord is.

Meertalige transcriptie

Transcribeer audio in ongeveer 40 taalvarianten met één model, zonder aparte checkpoints per taal te beheren.

Analyse van gesprekken en vergaderingen

Zet telefoongesprekken en vergaderingen om in doorzoekbare, interpunctietekst voor kwaliteitsborging, compliance en samenvattingen.

Media- en podcastworkflows

Maak transcripties op voor bewerking, toon notities en ontdek fragmenten en verfijn ze vervolgens in een volledige transcriptiewerkruimte.

Toegankelijkheidstools

Bied realtime spraak-naar-tekst voor toegankelijkheid, notities en dicteerervaringen.

Huidig fal-eindpunt Deze demo maakt gebruik van de nvidia/nemotron-asr-multilingual/asr eindpunt voor gehoste Nemotron ASR-transcriptie. Providerfouten, time-outs of problemen met de accountconfiguratie worden terugbetaald tijdens de demoroute. De Nemotron 3.5 ASR-gewichten zijn open Hugging Face voor zelfhosting, en u kunt altijd transcriberen in de Whisper AI-werkruimte .

Veelgestelde vragen

Nemotron 3.5 ASR veelgestelde vragen

Veelgestelde vragen over Nemotron, Nemotron AI en Nemotron 3.5 ASR.

Wat is Nemotron 3.5 ASR?

Nemotron 3.5 ASR is het open, meertalige streaming-spraakherkenningsmodel (ASR) van NVIDIA met 0,6 miljard parameters. Het transcribeert audio in realtime met een Cache-Aware FastConformer-RNNT-architectuur, bestrijkt met één checkpoint ongeveer 40 taalvarianten en levert zelf leestekens en hoofdlettergebruik.

Wat is Nemotron?

Nemotron is NVIDIA's familie van open AI-modellen, uitgebracht met open gewichten, trainingsgegevens en recepten. De familie omvat taal- en spraakmodellen en wordt geleverd als NVIDIA NIM-microservices. Nemotron 3.5 ASR is het spraakherkenningslid dat op deze pagina wordt gebruikt.

Kan Nemotron AI hier gratis worden geprobeerd?

Je hebt een gratis Whisper AI-account nodig om de demo uit te voeren, en elke transcriptie kost 1 credit. Nieuwe accounts worden geleverd met gratis starttegoed, zodat u Nemotron meteen kunt uitproberen, en u kunt op elk gewenst moment opwaarderen op de prijspagina.

Hoeveel talen ondersteunt Nemotron 3.5 ASR?

Eén checkpoint met 0,6 miljard parameters ondersteunt ongeveer 40 taalvarianten (circa 36 talen) met taal-ID-promptconditionering, zodat u geen apart model per taal nodig hebt.

Wat doet de versnellingsinstelling?

Versnelling regelt de grootte van het streamingfragment en daarmee de afweging tussen latentie en nauwkeurigheid. geen enkele gebruikt chunks van ~1,12s voor de beste nauwkeurigheid; normaal, hoog en volledig gebruik steeds kleinere stukjes voor lagere latentie.

Welke audioformaten en formaten werken?

fal documenteert mp3, ogg, wav, m4a en aac voor de bestandsinvoer, en een data-URI wordt geaccepteerd. Deze demo beperkt browseruploads tot ongeveer 10 MB; voor langere bestanden host u deze en plakt u in plaats daarvan een openbare URL.

Is mijn audio privé?

Uw FAL_KEY bereikt nooit de browser; verzoeken gaan via onze server. De audio zelf wordt ter verwerking naar het gehoste eindpunt van NVIDIA op fal gestuurd, dus vermijd het uploaden van vertrouwelijke opnamen naar de openbare demo.

Waarom zegt de demo soms dat het eindpunt niet beschikbaar is?

De demo is afhankelijk van het gehoste NVIDIA Nemotron ASR-eindpunt van fal, uw accounttegoeden en onze FAL_KEY-configuratie aan de serverzijde. Als de provider niet beschikbaar is of als er een time-out optreedt bij een verzoek, koppelt de demo u aan de Whisper AI-werkruimte, zodat u uw audio nog steeds kunt laten transcriberen.

Probeer Nemotron AI spraak-naar-tekst

Upload een clip, kies een versnellingsniveau en lees binnen enkele seconden een transcriptie met leestekens. Verken vervolgens de open Nemotron-gewichten om uw eigen pijplijn op te bouwen.

Open gewichten · 0.6B-parameters · ~40 taallocales