Nemotron 3.5 ASR — NVIDIA strömmande tal-till-text
Testa Nemotron AI ljud-till-text direkt i webbläsaren
Nemotron är NVIDIA:s familj av öppna modeller, och Nemotron 3.5 ASR är dess flerspråkiga strömmande taligenkänningsmodell med 0,6 miljarder parametrar. Ladda upp ett klipp eller klistra in en ljud-URL nedan och få en transkription med skiljetecken på några sekunder.
Använd automatisk identifiering om du inte vet vilket språk som talas mest.
Högre acceleration använder mindre strömmande segment för lägre latens; none behåller 1,12 s-segment för bästa precision, medan full använder 0,08 s-segment för lägsta latens.
för att köra demon. Nya konton får gratis startkrediter; varje körning kostar sedan 1 kredit.
Observera: den här demon skickar ljud till NVIDIA:s hostade Nemotron 3.5 ASR slutpunkt på fal via vår server. Om leverantören inte är tillgänglig kan ditt ljud transkriberas säkert i Whisper AI-arbetsytan.
Detta är en oberoende guide. Nemotron och Nemotron 3.5 ASR är produkter från NVIDIA; demon körs via fal:s hostade nvidia/nemotron-asr-multilingual/asr slutpunkt.
Vad är Nemotron 3.5 ASR?
Nemotron 3.5 ASR är en flerspråkig strömmande taligenkänningsmodell från NVIDIA med 600 miljoner parametrar. Den är talmodellen i Nemotron-familjen av öppna modeller — släppt med öppna vikter, träningsdata och recept, och tillgänglig som NVIDIA NIM-mikrotjänster.
Under huven använder den en Cache-Aware FastConformer-RNNT-arkitektur med språk-ID-promptning, så en enda kontrollpunkt hanterar ungefär 40 språk-lokaler och genererar inbyggda skiljetecken och versalisering.
Den interaktiva panelen högst upp på sidan låter dig testa Nemotron AI tal-till-text direkt. Den anropar den hostade fal-slutpunkten från vår server så att API-nyckeln förblir privat, medan de öppna vikterna fortfarande finns på Hugging Face för egen hosting.
Varför Nemotron 3.5 ASR sticker ut
Strömmande igenkänning, en kompakt flerspråkig kontrollpunkt och latens som kan finjusteras vid körning gör Nemotron till en praktisk tal-till-text-modell.
Strömmande taligenkänning med låg latens
Nemotron 3.5 ASR är byggd för taligenkänning i realtid. NVIDIA rapporterar tid till slutligt resultat under 100 ms på korta segment — se siffran som ett leverantörsriktmärke, men designen siktar på live-textning och röstagenter.
Cache-Aware FastConformer-RNNT
Modellen använder en Cache-Aware FastConformer-encoder med en RNNT-decoder, så den återanvänder strömmande kontext effektivt i stället för att bearbeta buffrat ljud på nytt i varje steg.
Flerspråkig i en enda kontrollpunkt
En enda kontrollpunkt med 0,6 miljarder parametrar täcker ungefär 40 språk-lokaler (cirka 36 språk) med språk-ID-promptning — inget byte av modell per språk behövs.
Inbyggda skiljetecken och versalisering
Transkriptionerna kommer tillbaka med skiljetecken och versalisering inbyggt, så resultatet blir naturligt läsbart utan ett separat återställningssteg.
Latens som kan konfigureras vid körning
Växla mellan segmentstorlekar — ungefär 1,12 s, 0,56 s, 0,32 s och 0,08 s — för att byta precision mot hastighet vid förfrågan via accelerationsinställningen, utan ny driftsättning.
Kompakt modell med 0,6 miljarder parametrar
Med 600 miljoner parametrar är modellen tillräckligt liten för att serveras med hög samtidighet. NVIDIA anger tydligt högre GPU-samtidighet än buffrade metoder; behandla genomströmningspåståenden som leverantörssiffror.
Del av den öppna Nemotron-familjen
Nemotron är NVIDIA:s familj av öppna modeller — släppt med öppna vikter, träningsdata och recept, och tillgänglig som NVIDIA NIM-mikrotjänster för egen hosting.
Serverbaserat via fal API
Den här sidan anropar den aktuella NVIDIA Nemotron ASR-slutpunkten på fal från servern, så din FAL_KEY förblir privat och webbläsaranvändare bara får transkriptionen.
Transkribera med Nemotron i fyra steg
Allt sker i demon ovan — logga bara in med ett gratis konto för att starta. Varje körning kostar 1 kredit.
Lägg till ditt ljud
Ladda upp ett kort klipp (mp3, wav, ogg, m4a eller aac, upp till 10 MB) eller klistra in en publik ljud-URL i Nemotron-demon högst upp på sidan.
Välj språk och acceleration
Låt språket stå på automatisk identifiering eller välj en stödd lokal, och välj sedan none, regular, high eller full acceleration beroende på den precision-latens-balans du vill ha.
Kör transkriberingen
Tryck på Transkribera. Förfrågan skickas till vår server, som anropar fal-slutpunkten för Nemotron 3.5 ASR med din nyckel privat, och returnerar sedan texten.
Kopiera eller finjustera resultatet
Läs den interpunkterade transkriptionen, kopiera den och justera acceleration eller indata om du vill jämföra precision och hastighet på samma klipp.
Välj accelerationsnivå
Acceleration ställer in storleken på de strömmande segmenten. Mindre segment ger lägre latens; större segment ger mer kontext och bättre precision.
Bäst precision. Använd för slutliga transkriptioner, inspelningar och allt du ska publicera.
Balanserad latens och precision — standardvalet för de flesta demoklipp.
Snabbare svar för interaktiv användning, med en tydligare precisionskompromiss.
Lägsta latens för live-textning och röstagenter; räkna med den största precisionskompromissen.
Segmentstorlekarna är ungefärliga och följer NVIDIA:s dokumenterade konfigurationer. fal visar för närvarande priser på ungefär 0,008 USD per minut; kontrollera fal:s API-dokumentation för aktuellt schema och aktuella priser.
Vad du kan bygga med Nemotron 3.5 ASR
Taligenkänning med låg latens och flera språk passar många typer av ljudprodukter.
Live-textning och undertexter
Strömma tal till läsbara, interpunkterade texter för möten, webbinarier och sändningar där latens spelar roll.
Röstagenter och assistenter
Mata transkriptioner med låg latens till konversations-AI så att assistenter kan svara medan användaren fortfarande talar.
Flerspråkig transkribering
Transkribera ljud över ungefär 40 språk-lokaler från en enda modell utan att hantera separata kontrollpunkter per språk.
Samtals- och mötesanalys
Gör samtal och möten till sökbar, interpunkterad text för QA, efterlevnad och sammanfattningspipelines.
Medie- och podcastflöden
Skapa utkast till transkriptioner för redigering, programanteckningar och klippupptäckt, och finjustera sedan i en fullständig transkriberingsarbetsyta.
Tillgänglighetsverktyg
Ge tal-till-text i realtid för tillgänglighet, anteckningar och dikteringsupplevelser.
Aktuell fal-slutpunkt. Den här demon använder nvidia/nemotron-asr-multilingual/asr slutpunkten för hostad Nemotron ASR-transkribering. Leverantörsfel, tidsgränser eller kontokonfigurationsproblem återbetalas i demorutten. Vikterna för Nemotron 3.5 ASR är öppna på Hugging Face för egen hosting, och du kan alltid transkribera i Whisper AI-arbetsytan .
Vanliga frågor om Nemotron 3.5 ASR
Vanliga frågor om Nemotron, Nemotron AI och Nemotron 3.5 ASR.
Vad är Nemotron 3.5 ASR?
Nemotron 3.5 ASR är NVIDIA:s öppna, flerspråkiga strömmande taligenkänningsmodell (ASR) med 0,6 miljarder parametrar. Den transkriberar ljud till text i realtid med en Cache-Aware FastConformer-RNNT-arkitektur, täcker ungefär 40 språk-lokaler i en enda kontrollpunkt och matar ut inbyggda skiljetecken och versalisering.
Vad är Nemotron?
Nemotron är NVIDIA:s familj av öppna AI-modeller, släppta med öppna vikter, träningsdata och recept. Familjen omfattar språk- och talmodeller och levereras som NVIDIA NIM-mikrotjänster. Nemotron 3.5 ASR är taligenkänningsmodellen som används på den här sidan.
Är Nemotron AI gratis att testa här?
Du behöver ett gratis Whisper AI-konto för att köra demon, och varje transkribering kostar 1 kredit. Nya konton får gratis startkrediter så att du kan testa Nemotron direkt, och du kan fylla på när som helst på prissidan.
Hur många språk stöder Nemotron 3.5 ASR?
En enda kontrollpunkt med 0,6 miljarder parametrar stöder ungefär 40 språk-lokaler — cirka 36 språk — med språk-ID-promptning, så du behöver inte en separat modell per språk.
Vad gör accelerationsinställningen?
Acceleration styr storleken på de strömmande segmenten och därmed kompromissen mellan latens och precision. none använder segment på ~1,12 s för bästa precision; regular, high och full använder stegvis mindre segment för lägre latens.
Vilka ljudformat och storlekar fungerar?
fal dokumenterar mp3, ogg, wav, m4a och aac för filinmatning, och en data-URI accepteras. Den här demon håller webbläsaruppladdningar runt 10 MB; för längre filer bör du hosta dem och klistra in en publik URL i stället.
Är mitt ljud privat?
Din FAL_KEY når aldrig webbläsaren — förfrågningar går via vår server. Själva ljudet skickas till NVIDIA:s hostade slutpunkt på fal för bearbetning, så undvik att ladda upp konfidentiella inspelningar i den publika demon.
Varför säger demon ibland att slutpunkten inte är tillgänglig?
Demon beror på fal:s hostade NVIDIA Nemotron ASR-slutpunkt, dina kontokrediter och vår serverkonfiguration för FAL_KEY. Om leverantören inte är tillgänglig eller en förfrågan får tidsgräns länkar demon dig till Whisper AI-arbetsytan så att du ändå kan få ditt ljud transkriberat.
Testa Nemotron AI tal-till-text
Ladda upp ett klipp, välj accelerationsnivå och läs en transkription med skiljetecken på några sekunder — utforska sedan de öppna Nemotron-vikterna för att bygga din egen pipeline.
Öppna vikter · 0,6 miljarder parametrar · ~40 språk-lokaler
