NVIDIA 개방형 모델 · 스트리밍 음성 인식

Nemotron 3.5 ASR — NVIDIA 스트리밍 음성 텍스트 변환

브라우저에서 Nemotron AI 음성 텍스트 변환을 바로 사용해 보세요

Nemotron은 NVIDIA의 개방형 모델 제품군이며, Nemotron 3.5 ASR은 0.6B 다국어 스트리밍 음성 인식 모델입니다. 아래에서 클립을 업로드하거나 오디오 URL을 붙여넣고 몇 초 만에 구두점이 포함된 전사문을 받아보세요.

0.6B 매개변수~40개 언어 로케일Cache-Aware FastConformer-RNNT스트리밍구두점 및 대문자 사용
Nemotron 3.5 ASR · 라이브 데모

주요 음성 언어를 모르는 경우 자동 감지를 사용하세요.

가속

가속 수준이 높을수록 지연 시간을 줄이기 위해 더 작은 스트리밍 청크를 사용합니다. 없음 최고의 정확도를 위해 1.12초 청크를 유지하는 동시에 최대 가장 낮은 대기 시간을 위해 0.08초 청크를 사용합니다.

데모를 실행합니다. 신규 계정에는 무료 스타터 크레딧이 제공됩니다. 각 실행에는 비용이 듭니다 1 크레딧.

주의: 이 데모는 오디오를 NVIDIA의 호스팅 Nemotron 3.5 ASR fal 엔드포인트로 전송합니다. 공급자를 사용할 수 없는 경우에도 Whisper AI 작업 공간.

이 페이지는 독립 가이드입니다. Nemotron과 Nemotron 3.5 ASR은 NVIDIA의 제품이며, 데모는 fal에서 호스팅하는 nvidia/nemotron-asr-multilingual/asr 엔드포인트를 사용합니다.

개요

Nemotron 3.5 ASR이란 무엇인가요?

Nemotron 3.5 ASR은 NVIDIA의 6억 매개변수 다국어 스트리밍 음성 인식 모델입니다. 공개 가중치와 학습 데이터 및 레시피를 제공하고 NVIDIA NIM 마이크로서비스로도 사용할 수 있는 Nemotron 오픈 모델 제품군의 음성 모델입니다.

언어 ID 프롬프트 조건을 적용한 Cache-Aware FastConformer-RNNT 아키텍처를 사용해 하나의 체크포인트로 약 40개 언어 로케일을 처리하며, 구두점과 대문자를 기본으로 출력합니다.

이 페이지 상단에 있는 대화형 패널을 사용하면 지금 바로 Nemotron AI 음성을 텍스트로 변환해 볼 수 있습니다. 이는 서버에서 호스팅된 fal 엔드포인트를 호출하므로 API 키는 비공개로 유지되고 자체 호스팅을 위해 Hugging Face에서 개방형 가중치를 계속 사용할 수 있습니다.

특징

Nemotron 3.5 ASR이 돋보이는 이유

스트리밍 인식, 간결한 다국어 체크포인트와 런타임에서 조정 가능한 지연 시간 덕분에 Nemotron은 실용적인 음성 텍스트 변환 모델입니다.

스트리밍, 지연 시간이 짧은 전사

Nemotron 3.5 ASR은 실시간 스트리밍 인식을 위해 설계되었습니다. NVIDIA는 짧은 청크에서 최종 결과까지 100ms 미만이 걸린다고 보고합니다. 공급업체 벤치마크 수치이지만, 라이브 캡션과 음성 에이전트를 목표로 한 설계입니다.

Cache-Aware FastConformer-RNNT

이 모델은 RNNT 디코더와 함께 캐시 인식 FastConformer 인코더를 사용하므로 모든 단계에서 버퍼링된 오디오를 재처리하는 대신 스트리밍 컨텍스트를 효율적으로 재사용합니다.

하나의 체크포인트에서 다국어 지원

단일 0.6B 체크포인트는 언어 ID 프롬프트 조건을 통해 대략 40개 언어 로캘(약 36개 언어)을 포괄하므로 언어별 모델 교체가 필요하지 않습니다.

기본 구두점 및 대문자 사용

전사문에는 구두점과 대문자가 포함되어 있어 별도의 복원 단계 없이도 자연스럽게 읽을 수 있습니다.

런타임 구성 가능 대기 시간

약 1.12초, 0.56초, 0.32초, 0.08초의 청크 크기를 전환해 요청마다 정확도와 속도의 균형을 조절할 수 있으며 재배포할 필요가 없습니다.

경량 0.6B 모델

6억 매개변수 규모로 높은 동시성을 지원하기에 충분히 작습니다. NVIDIA는 버퍼링 방식보다 GPU 동시성이 크게 높다고 설명하지만, 처리량 수치는 공급업체 벤치마크로 간주하세요.

개방형 Nemotron 제품군의 일부

Nemotron은 NVIDIA의 오픈 모델 제품군으로, 공개 가중치와 학습 데이터 및 레시피를 제공하며 자체 호스팅용 NVIDIA NIM 마이크로서비스로도 사용할 수 있습니다.

fal API를 통한 서버 측

이 페이지는 현재 NVIDIA Nemotron ASR fal 엔드포인트를 서버에서 호출하므로 FAL_KEY는 비공개로 유지되고 브라우저에는 전사문만 전달됩니다.

사용방법

Nemotron으로 4단계 만에 음성을 텍스트로 변환

모든 작업은 위의 데모에서 이루어집니다. 시작하려면 무료 계정으로 로그인하세요. 각 실행 비용은 1크레딧입니다.

1

오디오 추가

짧은 클립(mp3, wav, ogg, m4a 또는 aac, 최대 10 MB)을 업로드하거나 공개 오디오 URL을 이 페이지 상단의 Nemotron 데모에 붙여넣으세요.

2

언어 및 가속 수준 선택

언어를 자동 감지로 두거나 지원되는 로캘을 선택한 다음 원하는 정확도-지연 시간 균형에 따라 없음, 일반, 높음 또는 전체 가속을 선택합니다.

3

전사 실행

전사를 누릅니다. 요청은 당사 서버로 전송되며, 서버는 키를 비공개로 유지하면서 fal Nemotron 3.5 ASR 엔드포인트를 호출한 다음 텍스트를 반환합니다.

4

결과 복사 또는 다듬기

구두점이 포함된 전사문을 확인하고 복사하세요. 같은 클립에서 정확도와 속도를 비교하려면 가속 수준이나 입력을 조정하면 됩니다.

지연 시간과 정확성

가속 수준 선택

가속은 스트리밍 청크 크기를 설정합니다. 청크가 작을수록 대기 시간이 짧아집니다. 청크가 클수록 더 많은 맥락과 더 나은 정확성을 의미합니다.

없음~1.12초 청크

최고의 정확도. 최종 전사문, 녹취록 및 게시할 콘텐츠에 사용하세요.

일반~0.56초 청크

지연 시간과 정확도의 균형이 좋아 대부분의 데모 클립에 적합한 기본 선택입니다.

높음~0.32초 청크

정확도를 일부 낮추는 대신 대화형 사용에서 더 빠르게 응답합니다.

최대~0.08초 청크

라이브 캡션과 음성 에이전트에서 지연 시간이 가장 짧지만 정확도 손실이 가장 클 수 있습니다.

청크 크기는 근사값이며 NVIDIA 문서의 구성을 따릅니다. fal의 현재 표시 요금은 분당 약 $0.008입니다. 최신 스키마와 요금은 fal API 문서에서 확인하세요.

사용 사례

Nemotron 3.5 ASR로 만들 수 있는 것

지연 시간이 짧은 다국어 음성 인식은 다양한 오디오 제품에 적합합니다.

라이브 캡션 및 자막

지연 시간이 중요한 회의, 웨비나와 방송에서 음성을 읽기 쉽고 구두점이 포함된 자막으로 실시간 변환합니다.

음성 에이전트 및 AI 비서

사용자가 말하는 동안 AI 비서가 응답할 수 있도록 지연 시간이 짧은 전사문을 대화형 AI에 전달합니다.

다국어 전사

언어별 체크포인트를 번갈아 관리하지 않고도 단일 모델에서 약 40개 언어 로케일의 오디오를 텍스트로 변환할 수 있습니다.

통화 및 회의 분석

통화 및 회의를 QA, 규정 준수 및 요약 파이프라인을 위한 검색 가능한 구두점 텍스트로 전환하세요.

미디어 및 팟캐스트 워크플로

편집용 전사문 초안, 쇼 노트와 클립 검색 자료를 만든 뒤 전체 전사 작업 공간에서 다듬으세요.

접근성 도구

접근성, 메모 작성, 받아쓰기 경험을 위해 실시간 음성-텍스트 변환을 제공합니다.

현재 사용 중인 fal 엔드포인트 이 데모에서는 nvidia/nemotron-asr-multilingual/asr 호스팅된 Nemotron ASR 전사 엔드포인트를 사용합니다. 공급자 오류, 시간 초과 또는 계정 구성 문제로 실패하면 데모 경로에서 크레딧이 환불됩니다. Nemotron 3.5 ASR 가중치는 Hugging Face 에 공개되어 있어 자체 호스팅할 수 있으며, 언제든지 Whisper AI 작업 공간 .

FAQ

Nemotron 3.5 ASR 자주 묻는 질문

Nemotron, Nemotron AI 및 Nemotron 3.5 ASR에 대한 일반적인 질문입니다.

Nemotron 3.5 ASR이란 무엇인가요?

Nemotron 3.5 ASR은 NVIDIA의 공개 가중치 기반 6억 매개변수 다국어 스트리밍 음성 인식(ASR) 모델입니다. Cache-Aware FastConformer-RNNT 아키텍처로 실시간 음성 텍스트 변환을 수행하고, 단일 체크포인트에서 약 40개 언어 로케일과 기본 구두점 및 대문자를 지원합니다.

Nemotron이란 무엇인가요?

Nemotron은 공개 가중치와 학습 데이터 및 레시피를 함께 제공하는 NVIDIA의 오픈 AI 모델 제품군입니다. 언어 모델과 음성 모델을 아우르며 NVIDIA NIM 마이크로서비스로도 제공됩니다. Nemotron 3.5 ASR은 이 페이지에서 사용하는 음성 인식 모델입니다.

Nemotron AI는 여기에서 무료로 사용해 볼 수 있나요?

데모를 실행하려면 무료 Whisper AI 계정이 필요하며, 각 텍스트 변환 비용은 1크레딧입니다. 신규 계정에는 무료 스타터 크레딧이 제공되므로 즉시 Nemotron을 사용해 볼 수 있고 가격 페이지에서 언제든지 충전할 수 있습니다.

Nemotron 3.5 ASR은 몇 개 언어를 지원하나요?

단일 0.6B 체크포인트는 언어 ID 프롬프트 조건을 사용하여 대략 40개 언어(약 36개 언어)를 지원하므로 언어별로 별도의 모델이 필요하지 않습니다.

가속 설정은 무엇을 합니까?

가속은 스트리밍 청크 크기를 바꿔 지연 시간과 정확도의 균형을 조절합니다. '없음'은 최고의 정확도를 위해 약 1.12초 청크를 사용하고, 일반·높음·최대 단계로 갈수록 더 작은 청크를 사용해 지연 시간을 줄입니다.

어떤 오디오 형식과 크기가 작동합니까?

fal 문서에 따르면 파일 입력은 mp3, ogg, wav, m4a 및 aac와 데이터 URI를 지원합니다. 이 데모의 브라우저 업로드 한도는 약 10 MB입니다. 더 긴 파일은 별도로 호스팅한 뒤 공개 URL을 붙여넣으세요.

내 오디오는 비공개인가요?

FAL_KEY는 브라우저에 노출되지 않고 요청은 서버를 통해 전달됩니다. 다만 오디오 자체는 처리를 위해 fal의 NVIDIA 호스팅 엔드포인트로 전송되므로 공개 데모에 기밀 녹음을 업로드하지 마세요.

데모에서 가끔 엔드포인트를 사용할 수 없다고 표시되는 이유는 무엇입니까?

데모는 fal이 호스팅하는 NVIDIA Nemotron ASR 엔드포인트, 사용자 계정의 크레딧 및 서버 측 FAL_KEY 구성에 따라 달라집니다. 공급자를 사용할 수 없거나 요청 시간이 초과된 경우 데모를 통해 Whisper AI 작업 공간으로 연결되므로 계속해서 오디오를 전사할 수 있습니다.

Nemotron AI 음성을 텍스트로 변환해 보세요

클립을 업로드하고 가속 수준을 선택해 몇 초 만에 구두점이 포함된 전사문을 확인하세요. 공개 Nemotron 가중치로 자체 파이프라인도 구축할 수 있습니다.

개방형 가중치 · 0.6B 매개변수 · ~40개 언어 로케일