Nemotron 3.5 ASR — NVIDIA 串流語音轉文字
在瀏覽器中即時試用 Nemotron AI 音訊轉文字
Nemotron 是 NVIDIA 的開放模型家族,而 Nemotron 3.5 ASR 是其擁有 0.6B 參數的多語言串流語音辨識模型。在下方上傳片段或貼上音訊 URL,幾秒內即可獲得帶標點的轉錄文字。
除非你知道主要使用的語言,否則請使用自動偵測。
更高的加速使用更小的串流分塊以降低延遲; none 保持 1.12 秒分塊以獲得最佳精度,而 full 使用 0.08 秒分塊以獲得最低延遲。
以執行 Demo。新帳戶可獲得免費起始點數;之後每次執行消耗 1 點數.
提示:本 Demo 透過我們的伺服器將音訊傳送到 NVIDIA 託管的 Nemotron 3.5 ASR fal 端點。如果供應商不可用,你的音訊可以安全地在 Whisper AI 工作區中轉錄。
這是一份獨立指南。Nemotron 與 Nemotron 3.5 ASR 是以下公司的產品: NVIDIA;Demo 透過 fal 託管的端點執行 nvidia/nemotron-asr-multilingual/asr 。
什麼是 Nemotron 3.5 ASR?
Nemotron 3.5 ASR 是 NVIDIA 推出的多語言串流語音辨識模型,擁有 6 億參數。它是 Nemotron 開放模型家族中的語音成員——以開放權重、訓練資料和配方釋出,並以 NVIDIA NIM 微服務形式提供。
在底層,它採用帶語言 ID 提示條件的 Cache-Aware FastConformer-RNNT 架構,因此單個檢查點即可處理約 40 種語言區域,並直接輸出原生的標點與大小寫。
本頁頂部的互動面板讓你現在就能試用 Nemotron AI 語音轉文字。它從我們的伺服器呼叫 fal 託管端點,因此 API 金鑰保持私密,而開放權重仍可在 Hugging Face 上獲取以便自託管。
Nemotron 3.5 ASR 為何出眾
串流辨識、緊湊的多語言檢查點以及可在執行時調節的延遲,使 Nemotron 成為一個實用的語音轉文字模型。
串流、低延遲轉錄
Nemotron 3.5 ASR 專為即時串流辨識打造。NVIDIA 稱在短分塊上的最終結果耗時低於 100 毫秒——請將該數字視為廠商基準,但其設計明確面向即時字幕和語音代理。
Cache-Aware FastConformer-RNNT
該模型採用 Cache-Aware FastConformer 編碼器與 RNNT 解碼器,因此能高效複用串流上下文,而不必在每一步重新處理緩衝的音訊。
單個檢查點即可多語言
單個 0.6B 檢查點藉助語言 ID 提示條件覆蓋約 40 種語言區域(約 36 種語言)——無需按語言切換模型。
原生標點與大小寫
轉錄結果自帶標點與大小寫,因此無需單獨的還原步驟,輸出即可自然閱讀。
執行時可設定的延遲
透過加速設定在大約 1.12 秒、0.56 秒、0.32 秒和 0.08 秒的分塊之間切換,在請求時以精度換取速度,無需重新部署。
緊湊的 0.6B 體量
憑藉 6 億參數,該模型足夠小巧,可在高併發下提供服務。NVIDIA 稱其 GPU 併發顯著高於緩衝式方案;請將吞吐量資料視為廠商數字。
開放 Nemotron 家族的一員
Nemotron 是 NVIDIA 的開放模型家族——以開放權重、訓練資料和配方釋出,並以 NVIDIA NIM 微服務形式提供自託管。
透過 fal API 在伺服器端執行
本頁在伺服器端呼叫當前的 NVIDIA Nemotron ASR fal 端點,因此你的 FAL_KEY 保持私密,瀏覽器使用者只會收到轉錄文字。
四步使用 Nemotron 完成轉錄
一切都在上方的 Demo 中完成——只需用免費帳戶登入即可開始。每次執行消耗 1 個點數。
新增你的音訊
在本頁頂部的 Nemotron Demo 中上傳一段簡短音訊(mp3、wav、ogg、m4a 或 aac,最大 10 MB),或貼上一個公開的音訊 URL。
選擇語言和加速
將語言保留為自動偵測或選擇受支援的區域,然後根據所需的精度與延遲權衡,選擇 none、regular、high 或 full。
執行轉錄
點選轉錄。請求會傳送到我們的伺服器,由其在金鑰保持私密的情況下呼叫 fal 的 Nemotron 3.5 ASR 端點,然後返回文字。
複製或最佳化結果
閱讀帶標點的轉錄文字並複製,如果想在同一片段上比較精度與速度,可調整加速或輸入。
選擇合適的加速等級
加速決定串流分塊的大小。分塊越小,延遲越低;分塊越大,上下文越多,精度越好。
精度最佳。適用於最終轉錄稿、錄音以及任何將要釋出的內容。
延遲與精度均衡——大多數 Demo 片段的預設選擇。
為互動式使用提供更快的回應,精度權衡更明顯。
為即時字幕和語音代理提供最低延遲;預計精度權衡最大。
分塊大小為近似值,遵循 NVIDIA 技術文件記載的設定。fal 目前顯示的價格約為每分鐘 0.008 美元;請查閱 fal 的 API 技術文件以瞭解當前的方案與費率。
你可以用 Nemotron 3.5 ASR 建構什麼
低延遲、多語言的語音辨識適用於各類音訊產品。
即時字幕與字幕軌
在延遲至關重要的會議、網路研討會和直播中,將語音轉換為可讀、帶標點的字幕。
語音代理與助手
為對話式 AI 提供低延遲轉錄,讓助手在使用者仍在說話時就能作出回應。
多語言轉錄
用單個模型在約 40 種語言區域上轉錄音訊,無需管理按語言劃分的檢查點。
通話與會議分析
將通話和會議轉換為可搜尋、帶標點的文字,用於品質檢查、合規與摘要工作流程。
媒體與播客工作流程
為剪輯、節目筆記和片段發現起草轉錄稿,然後在完整的轉錄工作區中進行最佳化。
無障礙工具
為無障礙、記筆記和聽寫體驗提供即時語音轉文字。
目前的 fal 端點。 本 Demo 使用 nvidia/nemotron-asr-multilingual/asr 端點進行託管的 Nemotron ASR 轉錄。供應商錯誤、超時或帳戶設定問題會在 Demo 路由中退還點數。Nemotron 3.5 ASR 的權重在 Hugging Face 上開放以便自託管,你也可以隨時在 Whisper AI 工作區 中進行轉錄。
Nemotron 3.5 ASR 常見問題
關於 Nemotron、Nemotron AI 和 Nemotron 3.5 ASR 的常見問題。
什麼是 Nemotron 3.5 ASR?
Nemotron 3.5 ASR 是 NVIDIA 開放的、擁有 6 億參數的多語言串流語音辨識(ASR)模型。它採用 Cache-Aware FastConformer-RNNT 架構即時將音訊轉錄為文字,在單個檢查點中覆蓋約 40 種語言區域,並直接輸出原生的標點與大小寫。
什麼是 Nemotron?
Nemotron 是 NVIDIA 的開放 AI 模型家族,以開放權重、訓練資料和配方釋出。該家族涵蓋語言模型與語音模型,並以 NVIDIA NIM 微服務形式提供。Nemotron 3.5 ASR 是本頁使用的語音辨識成員。
在這裡可以免費試用 Nemotron AI 嗎?
執行 Demo 需要一個免費的 Whisper AI 帳戶,每次轉錄消耗 1 個點數。新帳戶附帶免費的起始點數,可立即試用 Nemotron,你也可以隨時在定價頁面儲值。
Nemotron 3.5 ASR 支援多少種語言?
單個 0.6B 檢查點藉助語言 ID 提示條件支援約 40 種語言區域——約 36 種語言——因此你無需為每種語言準備單獨的模型。
加速設定有什麼作用?
加速控制串流分塊的大小,從而決定延遲/精度的權衡。none 使用約 1.12 秒的分塊以獲得最佳精度;regular、high 和 full 使用逐漸更小的分塊以降低延遲。
支援哪些音訊格式和大小?
fal 的技術文件記錄了 mp3、ogg、wav、m4a 和 aac 檔案輸入,並接受 data URI。本 Demo 將瀏覽器上傳限制在約 10 MB;對於更長的檔案,請將其託管並貼上公開 URL。
我的音訊是否私密?
你的 FAL_KEY 永遠不會到達瀏覽器——請求都經由我們的伺服器。音訊本身會傳送到 NVIDIA 託管在 fal 上的端點進行處理,因此請勿向公開 Demo 上傳機密錄音。
為什麼 Demo 有時提示端點不可用?
Demo 依賴 fal 託管的 NVIDIA Nemotron ASR 端點、你的帳戶點數以及我們伺服器端的 FAL_KEY 設定。如果供應商不可用或請求超時,Demo 會引導你前往 Whisper AI 工作區,讓你仍能完成音訊轉錄。
試用 Nemotron AI 語音轉文字
上傳片段、選擇加速等級,幾秒內即可讀到帶標點的轉錄文字——然後探索開放的 Nemotron 權重,建構你自己的工作流程。
開放權重 · 0.6B 參數 · 約 40 種語言區域
