Model otwarty NVIDIA · Strumieniowe rozpoznawanie mowy

Nemotron 3.5 ASR — strumieniowa zamiana mowy na tekst NVIDIA

Wypróbuj funkcję konwersji dźwięku na tekst Nemotron AI na żywo w swojej przeglądarce

Nemotron to rodzina otwartych modeli NVIDIA, a Nemotron 3.5 ASR jest wielojęzycznym, strumieniowym modelem rozpoznawania mowy o 0,6 mld parametrów. Prześlij klip lub wklej adres URL pliku audio poniżej, aby w kilka sekund otrzymać transkrypcję z interpunkcją.

Parametry 0,6B~40 ustawień językowychFastConformer-RNNT obsługujący pamięć podręcznąTransmisja strumieniowaInterpunkcja i wielkie litery
Nemotron 3.5 ASR · Demo na żywo

Użyj automatycznego wykrywania, chyba że znasz główny język mówiony.

Przyspieszenie

Wyższe przyspieszenie wykorzystuje mniejsze fragmenty przesyłania strumieniowego w celu zmniejszenia opóźnień; brak utrzymuje fragmenty 1,12 s dla najlepszej dokładności, podczas gdy pełne wykorzystuje fragmenty o długości 0,08 s, aby uzyskać najniższe opóźnienie.

aby uruchomić demo. Nowe konta otrzymują darmowe kredyty na start; każde uruchomienie kosztuje 1 kredyt.

Uwaga: to demo wysyła dźwięk do modelu NVIDIA Nemotron 3.5 ASR w punkcie końcowym hostowanym przez fal.ai za pośrednictwem naszego serwera. Jeśli dostawca jest niedostępny, otwórz obszar roboczy Whisper AI.

To jest niezależny przewodnik. Nemotron i Nemotron 3.5 ASR są produktami firmy NVIDIA; demo korzysta z hostowanego endpointu nvidia/nemotron-asr-multilingual/asr w fal.ai.

Przegląd

Czym jest Nemotron 3.5 ASR?

Nemotron 3.5 ASR to wielojęzyczny, strumieniowy model rozpoznawania mowy firmy NVIDIA o 600 milionach parametrów. Należy do rodziny otwartych modeli Nemotron — jest udostępniany z otwartymi wagami, danymi treningowymi i recepturami oraz dostępny jako mikrousługa NVIDIA NIM.

Pod maską wykorzystuje architekturę FastConformer-RNNT obsługującą pamięć podręczną z warunkowaniem identyfikatora języka, dzięki czemu jeden punkt kontrolny obsługuje około 40 ustawień regionalnych języka i emituje natywną interpunkcję i wielkie litery.

Interaktywny panel na górze tej strony pozwala już teraz wypróbować zamianę mowy na tekst Nemotron AI. Wywołuje punkt końcowy hostowany przez fal.ai za pośrednictwem naszego serwera, więc klucz API pozostaje prywatny, a otwarte wagi są dostępne na Hugging Face do samodzielnego hostowania.

Funkcje

Dlaczego Nemotron 3.5 ASR się wyróżnia

Rozpoznawanie strumieniowe, kompaktowy, wielojęzyczny punkt kontrolny i opóźnienie dostosowujące się do czasu działania sprawiają, że Nemotron jest praktycznym modelem zamiany mowy na tekst.

Transmisja strumieniowa, transkrypcja z niskim opóźnieniem

Nemotron 3.5 ASR jest przeznaczony do rozpoznawania transmisji strumieniowej w czasie rzeczywistym. NVIDIA zgłasza czas do zakończenia krótszy niż 100 ms w przypadku krótkich fragmentów — tę liczbę należy traktować jako punkt odniesienia dla dostawcy, ale projekt dotyczy napisów na żywo i agentów głosowych.

FastConformer-RNNT obsługujący pamięć podręczną

W modelu zastosowano koder FastConformer obsługujący pamięć podręczną z dekoderem RNNT, dzięki czemu efektywnie ponownie wykorzystuje kontekst przesyłania strumieniowego, zamiast ponownie przetwarzać buforowany dźwięk na każdym kroku.

Wielojęzyczny w jednym punkcie kontrolnym

Pojedynczy punkt kontrolny 0,6B obejmuje około 40 ustawień regionalnych języka (około 36 języków) z warunkowaniem podpowiedzi identyfikatora języka — nie jest wymagana zamiana modelu dla poszczególnych języków.

Natywna interpunkcja i wielkie litery

Transkrypcje wracają z wbudowaną interpunkcją i wielkimi literami, więc wynik czyta się naturalnie, bez osobnej procedury przywracania.

Opóźnienie konfigurowalne w czasie wykonywania

Przełączaj się między rozmiarami porcji — około 1,12 s, 0,56 s, 0,32 s i 0,08 s — aby zamienić dokładność na prędkość w momencie żądania za pomocą ustawienia przyspieszenia, bez konieczności ponownego wdrażania.

Kompaktowy rozmiar 0,6B

Przy parametrach 600M model jest wystarczająco mały, aby służyć przy dużej współbieżności. NVIDIA przytacza znacznie wyższą współbieżność GPU niż podejścia buforowane; traktuj oświadczenia o przepustowości jako numery dostawców.

Część otwartej rodziny Nemotron

Nemotron to rodzina otwartych modeli NVIDIA — udostępniana z otwartymi wagami, danymi treningowymi i recepturami oraz dostępna jako mikrousługi NVIDIA NIM do samodzielnego hostowania.

Wywołanie po stronie serwera przez API fal.ai

Ta strona wywołuje bieżący punkt końcowy NVIDIA Nemotron ASR w fal.ai po stronie serwera, więc Twój FAL_KEY pozostaje prywatny, a użytkownicy przeglądarki otrzymują tylko transkrypcję.

Jak używać

Transkrypcja za pomocą Nemotronu w czterech krokach

Wszystko dzieje się w powyższej wersji demonstracyjnej — wystarczy zalogować się na darmowe konto, aby rozpocząć. Każdy przebieg kosztuje 1 kredyt.

1

Dodaj swój dźwięk

Prześlij krótki klip (mp3, wav, ogg, m4a lub aac, do 10 MB) lub wklej publiczny adres URL audio do wersji demonstracyjnej Nemotron na górze tej strony.

2

Wybierz język i przyspieszenie

Pozostaw język na automatycznym wykrywaniu lub wybierz obsługiwane ustawienia regionalne, a następnie wybierz żadne, regularne, wysokie lub pełne przyspieszenie, w zależności od pożądanego kompromisu w zakresie dokładności i opóźnienia.

3

Uruchom transkrypcję

Naciśnij przycisk transkrypcji. Żądanie trafia do naszego serwera, który wywołuje punkt końcowy Nemotron 3.5 ASR w fal.ai przy użyciu prywatnego klucza, a następnie zwraca tekst.

4

Skopiuj lub udoskonal wynik

Przeczytaj transkrypcję z interpunkcją, skopiuj ją i dostosuj przyspieszenie lub dane wejściowe, aby porównać dokładność i szybkość dla tego samego klipu.

Opóźnienie a dokładność

Wybór poziomu przyspieszenia

Przyspieszenie ustawia rozmiar fragmentu przesyłania strumieniowego. Mniejsze fragmenty oznaczają mniejsze opóźnienia; większe fragmenty oznaczają większy kontekst i większą dokładność.

brakFragmenty ~1,12 s

Najlepsza dokładność. Używaj do końcowych transkrypcji, nagrań i wszystkiego, co będziesz publikować.

standardoweFragmenty ~0,56 s

Zrównoważone opóźnienie i dokładność — domyślny wybór w przypadku większości klipów demonstracyjnych.

wysokieFragmenty ~0,32 s

Szybsze reakcje w zastosowaniach interaktywnych z wyraźniejszym kompromisem w zakresie dokładności.

pełneFragmenty ~0,08 s

Najniższe opóźnienie w przypadku napisów na żywo i agentów głosowych; należy liczyć się z największym spadkiem dokładności.

Rozmiary fragmentów są przybliżone i odpowiadają udokumentowanym konfiguracjom NVIDIA. fal.ai podaje obecnie cenę około 0,008 USD za minutę; sprawdź dokumentację API fal.ai, aby poznać aktualny schemat i stawki.

Przypadki użycia

Co możesz zbudować z Nemotron 3.5 ASR

Wielojęzyczne rozpoznawanie mowy o niskim opóźnieniu pasuje do szerokiej gamy produktów audio.

Napisy na żywo i napisy

Zamieniaj strumieniową mowę w czytelne napisy z interpunkcją podczas spotkań, webinarów i transmisji, w których liczy się niskie opóźnienie.

Agenci i asystenci głosowi

Przesyłaj transkrypcje o niskim opóźnieniu do konwersacyjnej sztucznej inteligencji, aby asystenci mogli odpowiadać, gdy użytkownik jeszcze mówi.

Transkrypcja wielojęzyczna

Transkrybuj dźwięk w około 40 wariantach językowych za pomocą jednego modelu, bez przełączania punktów kontrolnych dla poszczególnych języków.

Analityka połączeń i spotkań

Zamień rozmowy telefoniczne i spotkania w tekst z interpunkcją, który można przeszukiwać i wykorzystywać w procesach kontroli jakości, zgodności oraz tworzenia podsumowań.

Przepływ pracy z multimediami i podcastami

Twórz robocze transkrypcje do montażu, notatki do odcinków i wyszukiwania klipów, a następnie dopracowuj je w pełnym obszarze roboczym transkrypcji.

Narzędzia ułatwień dostępu

Zapewnij zamianę mowy na tekst w czasie rzeczywistym, aby zapewnić dostępność, możliwość robienia notatek i dyktowania.

Bieżący punkt końcowy fal.ai. To demo wykorzystuje nvidia/nemotron-asr-multilingual/asr endpoint do hostowanej transkrypcji Nemotron ASR. W przypadku błędu dostawcy, przekroczenia limitu czasu lub problemu z konfiguracją konta trasa demo zwraca wykorzystany kredyt. Otwarte wagi Nemotron 3.5 ASR są dostępne na Hugging Face do samodzielnego hostowania, a transkrypcję możesz zawsze wykonać w obszarze roboczym Whisper AI .

Często zadawane pytania

Nemotron 3.5 ASR często zadawane pytania

Często zadawane pytania dotyczące Nemotron, Nemotron AI i Nemotron 3.5 ASR.

Co to jest Nemotron 3.5 ASR?

Nemotron 3.5 ASR to otwarty, wielojęzyczny model strumieniowego rozpoznawania mowy (ASR) firmy NVIDIA o 0,6 miliarda parametrów. Transkrybuje dźwięk na tekst w czasie rzeczywistym przy użyciu architektury Cache-Aware FastConformer-RNNT, obsługuje około 40 wariantów językowych w jednym punkcie kontrolnym oraz generuje interpunkcję i wielkie litery.

Co to jest Nemotron?

Nemotron to rodzina otwartych modeli AI firmy NVIDIA, udostępniana z otwartymi wagami, danymi treningowymi i recepturami. Obejmuje modele językowe i modele mowy, a także jest dostępna jako mikrousługi NVIDIA NIM. Nemotron 3.5 ASR to model rozpoznawania mowy używany na tej stronie.

Czy Nemotron AI można tutaj bezpłatnie wypróbować?

Aby uruchomić demo, potrzebujesz bezpłatnego konta Whisper AI, a każda transkrypcja kosztuje 1 kredyt. Nowe konta otrzymują bezpłatne kredyty startowe, więc możesz od razu wypróbować Nemotron, a później w dowolnym momencie doładować konto na stronie z cennikiem.

Ile języków obsługuje Nemotron 3.5 ASR?

Pojedynczy punkt kontrolny 0,6B obsługuje około 40 ustawień regionalnych — około 36 języków — przy użyciu warunkowania podpowiedzi identyfikatora języka, więc nie jest potrzebny oddzielny model dla każdego języka.

Do czego służy ustawienie przyspieszenia?

Przyspieszenie kontroluje rozmiar fragmentu przesyłania strumieniowego, a tym samym kompromis między opóźnieniem a dokładnością. Ustawienie „brak” używa fragmentów ~1,12 s dla najlepszej dokładności, natomiast ustawienia standardowe, wysokie i pełne wykorzystują coraz mniejsze fragmenty, aby zmniejszyć opóźnienie.

Jakie formaty i rozmiary audio działają?

fal.ai obsługuje pliki mp3, ogg, wav, m4a i aac oraz identyfikatory URI danych. To demo przyjmuje pliki przesyłane z przeglądarki o rozmiarze do około 10 MB; większy plik umieść pod publicznym adresem URL i wklej ten adres zamiast przesyłać go bezpośrednio.

Czy mój dźwięk jest prywatny?

Twój FAL_KEY nigdy nie trafia do przeglądarki — żądania przechodzą przez nasz serwer. Sam dźwięk jest jednak wysyłany do hostowanego przez fal.ai punktu końcowego NVIDIA w celu przetworzenia, dlatego nie przesyłaj poufnych nagrań do publicznego demo.

Dlaczego w wersji demonstracyjnej czasami pojawia się komunikat, że punkt końcowy jest niedostępny?

Demo zależy od punktu końcowego NVIDIA Nemotron ASR hostowanego przez fal.ai, dostępnych środków i naszej konfiguracji FAL_KEY po stronie serwera. Jeśli dostawca jest niedostępny lub żądanie przekroczy limit czasu, demo przekieruje Cię do obszaru roboczego Whisper AI, gdzie nadal możesz wykonać transkrypcję.

Wypróbuj funkcję zamiany mowy na tekst Nemotron AI

Prześlij klip, wybierz poziom przyspieszenia i w kilka sekund przeczytaj transkrypcję z interpunkcją, a następnie poznaj otwarte wagi Nemotron i zbuduj własny proces przetwarzania.

Otwarte wagi · Parametry 0,6B · ~40 ustawień regionalnych