Offenes NVIDIA-Modell · Streaming-Spracherkennung

Nemotron 3.5 ASR — NVIDIA Streaming-Sprache-zu-Text

Teste Nemotron AI Audio-zu-Text direkt im Browser

Nemotron ist NVIDIAs Familie offener Modelle. Nemotron 3.5 ASR ist das mehrsprachige Streaming-Spracherkennungsmodell mit 0,6 Milliarden Parametern. Lade einen Clip hoch oder füge unten eine Audio-URL ein und erhalte in Sekunden ein transkribiertes Ergebnis mit Satzzeichen.

0,6 Mrd. Parameter~40 Sprach-LokalisierungenCache-Aware FastConformer-RNNTStreamingSatzzeichen & Großschreibung
Nemotron 3.5 ASR · Live-Demo

Nutze Auto-Erkennung, wenn du die hauptsächlich gesprochene Sprache nicht genau kennst.

Beschleunigung

Höhere Beschleunigung nutzt kleinere Streaming-Chunks für geringere Latenz; none behält 1,12-s-Chunks für beste Genauigkeit bei, während full 0,08-s-Chunks für die niedrigste Latenz nutzt.

um die Demo zu starten. Neue Konten erhalten kostenlose Start-Credits; jeder Lauf kostet danach 1 Credit.

Hinweis: Diese Demo sendet Audio an NVIDIAs gehosteten Nemotron 3.5 ASR Endpunkt auf fal über unseren Server. Wenn der Anbieter nicht verfügbar ist, kannst du dein Audio sicher im Whisper-AI-Arbeitsbereichtranskribieren.

Dies ist ein unabhängiger Leitfaden. Nemotron und Nemotron 3.5 ASR sind Produkte von NVIDIA; die Demo läuft über den gehosteten fal-Endpunkt nvidia/nemotron-asr-multilingual/asr .

Überblick

Was ist Nemotron 3.5 ASR?

Nemotron 3.5 ASR ist ein mehrsprachiges Streaming-Spracherkennungsmodell von NVIDIA mit 600 Millionen Parametern. Es gehört zur offenen Nemotron-Modellfamilie, die mit offenen Gewichten, Trainingsdaten und Rezepten veröffentlicht wurde und auch als NVIDIA-NIM-Microservice verfügbar ist.

Technisch nutzt das Modell eine Cache-Aware-FastConformer-RNNT-Architektur mit Sprach-ID-Prompting. Ein einzelner Checkpoint deckt dadurch rund 40 Sprach-Lokalisierungen ab und liefert Satzzeichen sowie Großschreibung direkt mit.

Im interaktiven Bereich oben kannst du Nemotron AI für Sprache-zu-Text sofort ausprobieren. Die Anfrage läuft serverseitig über den gehosteten fal-Endpunkt, damit der API-Schlüssel privat bleibt; die offenen Gewichte stehen weiterhin auf Hugging Face zum Self-Hosting bereit.

Funktionen

Warum Nemotron 3.5 ASR heraussticht

Streaming-Erkennung, ein kompaktes mehrsprachiges Modell und zur Laufzeit steuerbare Latenz machen Nemotron zu einem praktischen Sprache-zu-Text-Modell.

Streaming-Transkription mit niedriger Latenz

Nemotron 3.5 ASR ist für Echtzeit-Streaming-Erkennung gebaut. NVIDIA nennt eine Time-to-final unter 100 ms auf kurzen Chunks — behandle diese Zahl als Anbieter-Benchmark, aber das Design zielt klar auf Live-Untertitel und Voice Agents.

Cache-Aware FastConformer-RNNT

Das Modell kombiniert einen Cache-Aware-FastConformer-Encoder mit einem RNNT-Decoder und nutzt Streaming-Kontext effizient wieder, statt gepufferte Audiodaten bei jedem Schritt erneut zu verarbeiten.

Mehrsprachig in einem Checkpoint

Ein einzelner 0,6B-Checkpoint deckt rund 40 Sprach-Lokalisierungen ab und nutzt Sprach-ID-Prompting — du musst keine separaten Modelle pro Sprache wechseln.

Satzzeichen & Großschreibung nativ

Transkripte kommen direkt mit Satzzeichen und Großschreibung zurück, sodass der Text ohne separaten Wiederherstellungsschritt natürlich lesbar ist.

Latenz zur Laufzeit konfigurierbar

Wechsle zwischen Chunkgrößen von ungefähr 1,12 s, 0,56 s, 0,32 s und 0,08 s, um Genauigkeit und Geschwindigkeit pro Anfrage auszubalancieren — ohne Neu-Deployment.

Kompakte 0,6B-Größe

Mit 600 Millionen Parametern ist das Modell klein genug für hohe Parallelität. NVIDIA nennt deutlich höhere GPU-Concurrency als bei gepufferten Ansätzen; behandle Durchsatzangaben als Herstellerwerte.

Teil der offenen Nemotron-Familie

Nemotron ist NVIDIAs Familie offener Modelle — veröffentlicht mit offenen Gewichten, Trainingsdaten und Rezepten und verfügbar als NVIDIA-NIM-Microservices fürs Self-Hosting.

Serverseitig über die fal API

Diese Seite ruft den aktuellen NVIDIA-Nemotron-ASR-fal-Endpunkt serverseitig auf, damit dein FAL_KEY privat bleibt und Browser-Nutzer nur das Transkript erhalten.

Anleitung

Mit Nemotron in vier Schritten transkribieren

Alles passiert in der Demo oben — melde dich einfach mit einem kostenlosen Konto an. Jeder Lauf kostet 1 Credit.

1

Audio hinzufügen

Lade einen kurzen Clip hoch (mp3, wav, ogg, m4a oder aac, bis 10 MB) oder füge eine öffentliche Audio-URL in die Nemotron-Demo oben ein.

2

Sprache und Beschleunigung wählen

Lass die Sprache auf Auto-Erkennung oder wähle eine unterstützte Lokalisierung. Danach entscheidest du zwischen none, regular, high und full je nach gewünschtem Verhältnis aus Genauigkeit und Latenz.

3

Transkription starten

Klicke auf Transkribieren. Die Anfrage geht an unseren Server, der den fal-Endpunkt für Nemotron 3.5 ASR mit privatem Schlüssel aufruft und den Text zurückgibt.

4

Ergebnis kopieren oder verfeinern

Lies das Transkript mit Satzzeichen, kopiere es und passe Beschleunigung oder Eingabe an, wenn du Genauigkeit und Geschwindigkeit mit demselben Clip vergleichen möchtest.

Latenz vs. Genauigkeit

Die passende Beschleunigungsstufe wählen

Die Beschleunigung legt die Streaming-Chunkgröße fest. Kleinere Chunks bedeuten geringere Latenz; größere Chunks liefern mehr Kontext und bessere Genauigkeit.

none~1,12-s-Chunks

Beste Genauigkeit. Geeignet für finale Transkripte, Aufnahmen und Inhalte, die veröffentlicht werden.

regular~0,56-s-Chunks

Ausgewogenes Verhältnis aus Latenz und Genauigkeit — die Standardwahl für die meisten Demo-Clips.

high~0,32-s-Chunks

Schnellere Antworten für interaktive Nutzung, mit deutlicherem Genauigkeitskompromiss.

full~0,08-s-Chunks

Niedrigste Latenz für Live-Untertitel und Voice Agents; erwarte den größten Genauigkeitskompromiss.

Die Chunkgrößen sind Näherungswerte und folgen NVIDIAs dokumentierten Konfigurationen. fal zeigt derzeit Preise von ungefähr 0,008 USD pro Minute; prüfe die fal-API-Dokumentation für das aktuelle Schema und die aktuellen Preise.

Anwendungsfälle

Was du mit Nemotron 3.5 ASR bauen kannst

Mehrsprachige Spracherkennung mit niedriger Latenz passt zu vielen Audio-Produkten.

Live-Untertitel

Streame Sprache in lesbare Untertitel für Meetings, Webinare und Broadcasts, bei denen Latenz zählt.

Voice Agents & Assistenten

Gib Konversations-KI Transkripte mit niedriger Latenz, damit Assistenten reagieren können, während der Nutzer noch spricht.

Mehrsprachige Transkription

Transkribiere Audio über rund 40 Sprach-Lokalisierungen hinweg mit einem einzigen Modell, ohne sprachspezifische Checkpoints zu verwalten.

Call- & Meeting-Analyse

Wandle Gespräche und Meetings in durchsuchbaren Text für QA, Compliance und Zusammenfassungen um.

Medien- & Podcast-Workflows

Erstelle Rohtranskripte für Schnitt, Shownotes und Clip-Recherche und verfeinere sie anschließend im Transkriptions-Workspace.

Barrierefreiheit

Biete Echtzeit-Sprache-zu-Text für Barrierefreiheit, Notizen und Diktierfunktionen.

Aktueller fal-Endpunkt. Diese Demo nutzt den nvidia/nemotron-asr-multilingual/asr Endpunkt für gehostete Nemotron-ASR-Transkription. Provider-Fehler, Timeouts oder Kontokonfigurationsprobleme werden in der Demo-Route erstattet. Die Nemotron-3.5-ASR-Gewichte sind offen auf Hugging Face für Self-Hosting verfügbar; außerdem kannst du jederzeit im Whisper-AI-Arbeitsbereich transkribieren.

FAQ

Häufige Fragen zu Nemotron 3.5 ASR

Antworten zu Nemotron, Nemotron AI und Nemotron 3.5 ASR.

Was ist Nemotron 3.5 ASR?

Nemotron 3.5 ASR ist NVIDIAs offenes, mehrsprachiges Streaming-Spracherkennungsmodell mit 0,6 Milliarden Parametern. Es transkribiert Audio in Echtzeit mit einer Cache-Aware-FastConformer-RNNT-Architektur, deckt rund 40 Sprach-Lokalisierungen ab und gibt Satzzeichen sowie Großschreibung direkt aus.

Was ist Nemotron?

Nemotron ist NVIDIAs Familie offener KI-Modelle mit offenen Gewichten, Trainingsdaten und Rezepten. Die Familie umfasst Sprach- und Speech-Modelle und wird auch als NVIDIA-NIM-Microservices angeboten. Nemotron 3.5 ASR ist das Spracherkennungsmodell auf dieser Seite.

Kann ich Nemotron AI hier kostenlos testen?

Du benötigst ein kostenloses Whisper-AI-Konto für die Demo; jede Transkription kostet 1 Credit. Neue Konten erhalten Start-Credits, damit du Nemotron direkt ausprobieren kannst, und du kannst auf der Preisseite jederzeit aufladen.

Wie viele Sprachen unterstützt Nemotron 3.5 ASR?

Ein einzelner 0,6B-Checkpoint unterstützt rund 40 Sprach-Lokalisierungen — etwa 36 Sprachen — über Sprach-ID-Prompting. Du brauchst also kein separates Modell pro Sprache.

Was bewirkt die Beschleunigungseinstellung?

Die Beschleunigung steuert die Streaming-Chunkgröße und damit das Verhältnis aus Latenz und Genauigkeit. none nutzt ca. 1,12-s-Chunks für beste Genauigkeit; regular, high und full verwenden immer kleinere Chunks für geringere Latenz.

Welche Audioformate und Größen funktionieren?

fal dokumentiert mp3, ogg, wav, m4a und aac für Datei-Uploads; auch Data-URIs werden akzeptiert. Diese Demo begrenzt Browser-Uploads auf etwa 10 MB. Für längere Dateien kannst du sie hosten und eine öffentliche URL einfügen.

Ist mein Audio privat?

Dein FAL_KEY erreicht nie den Browser — Anfragen laufen über unseren Server. Das Audio selbst wird zur Verarbeitung an NVIDIAs gehosteten fal-Endpunkt gesendet. Lade daher keine vertraulichen Aufnahmen in die öffentliche Demo hoch.

Warum meldet die Demo manchmal, dass der Endpunkt nicht verfügbar ist?

Die Demo hängt vom gehosteten NVIDIA-Nemotron-ASR-Endpunkt auf fal, deinen Kontocredits und unserer serverseitigen FAL_KEY-Konfiguration ab. Wenn der Anbieter nicht verfügbar ist oder eine Anfrage ausläuft, verlinkt die Demo den Whisper-AI-Arbeitsbereich, damit du dein Audio trotzdem transkribieren kannst.

Teste Nemotron AI Sprache-zu-Text

Lade einen Clip hoch, wähle eine Beschleunigungsstufe und lies in Sekunden eine Transkription mit Satzzeichen — danach kannst du die offenen Nemotron-Gewichte für deine eigene Pipeline erkunden.

Offene Gewichte · 0,6 Mrd. Parameter · ~40 Sprach-Lokalisierungen