NVIDIA 开放模型 · 流式语音识别

Nemotron 3.5 ASR — NVIDIA 流式语音转文字

在浏览器中实时试用 Nemotron AI 音频转文字

Nemotron 是 NVIDIA 的开放模型家族,而 Nemotron 3.5 ASR 是其拥有 0.6B 参数的多语言流式语音识别模型。在下方上传片段或粘贴音频 URL,几秒内即可获得带标点的转录文本。

0.6B 参数约 40 种语言区域Cache-Aware FastConformer-RNNT流式处理标点与大小写
Nemotron 3.5 ASR · 实时演示

除非你知道主要使用的语言,否则请使用自动检测。

加速

更高的加速使用更小的流式分块以降低延迟; none 保持 1.12 秒分块以获得最佳精度,而 full 使用 0.08 秒分块以获得最低延迟。

以运行演示。新账户可获得免费起始积分;之后每次运行消耗 1 积分.

提示:本演示通过我们的服务器将音频发送到 NVIDIA 托管的 Nemotron 3.5 ASR fal 端点。如果提供方不可用,你的音频可以安全地在 Whisper AI 工作区中转录。

这是一份独立指南。Nemotron 与 Nemotron 3.5 ASR 是以下公司的产品: NVIDIA;演示通过 fal 托管的端点运行 nvidia/nemotron-asr-multilingual/asr

概览

什么是 Nemotron 3.5 ASR?

Nemotron 3.5 ASR 是 NVIDIA 推出的多语言流式语音识别模型,拥有 6 亿参数。它是 Nemotron 开放模型家族中的语音成员——以开放权重、训练数据和配方发布,并以 NVIDIA NIM 微服务形式提供。

在底层,它采用带语言 ID 提示条件的 Cache-Aware FastConformer-RNNT 架构,因此单个检查点即可处理约 40 种语言区域,并直接输出原生的标点与大小写。

本页顶部的交互面板让你现在就能试用 Nemotron AI 语音转文字。它从我们的服务器调用 fal 托管端点,因此 API 密钥保持私密,而开放权重仍可在 Hugging Face 上获取以便自托管。

特性

Nemotron 3.5 ASR 为何出众

流式识别、紧凑的多语言检查点以及可在运行时调节的延迟,使 Nemotron 成为一个实用的语音转文字模型。

流式、低延迟转录

Nemotron 3.5 ASR 专为实时流式识别打造。NVIDIA 称在短分块上的最终结果耗时低于 100 毫秒——请将该数字视为厂商基准,但其设计明确面向实时字幕和语音代理。

Cache-Aware FastConformer-RNNT

该模型采用 Cache-Aware FastConformer 编码器与 RNNT 解码器,因此能高效复用流式上下文,而不必在每一步重新处理缓冲的音频。

单个检查点即可多语言

单个 0.6B 检查点借助语言 ID 提示条件覆盖约 40 种语言区域(约 36 种语言)——无需按语言切换模型。

原生标点与大小写

转录结果自带标点与大小写,因此无需单独的还原步骤,输出即可自然阅读。

运行时可配置的延迟

通过加速设置在大约 1.12 秒、0.56 秒、0.32 秒和 0.08 秒的分块之间切换,在请求时以精度换取速度,无需重新部署。

紧凑的 0.6B 体量

凭借 6 亿参数,该模型足够小巧,可在高并发下提供服务。NVIDIA 称其 GPU 并发显著高于缓冲式方案;请将吞吐量数据视为厂商数字。

开放 Nemotron 家族的一员

Nemotron 是 NVIDIA 的开放模型家族——以开放权重、训练数据和配方发布,并以 NVIDIA NIM 微服务形式提供自托管。

通过 fal API 在服务器端运行

本页在服务器端调用当前的 NVIDIA Nemotron ASR fal 端点,因此你的 FAL_KEY 保持私密,浏览器用户只会收到转录文本。

如何使用

四步使用 Nemotron 完成转录

一切都在上方的演示中完成——只需用免费账户登录即可开始。每次运行消耗 1 个积分。

1

添加你的音频

在本页顶部的 Nemotron 演示中上传一段简短音频(mp3、wav、ogg、m4a 或 aac,最大 10 MB),或粘贴一个公开的音频 URL。

2

选择语言和加速

将语言保留为自动检测或选择受支持的区域,然后根据所需的精度与延迟权衡,选择 none、regular、high 或 full。

3

运行转录

点击转录。请求会发送到我们的服务器,由其在密钥保持私密的情况下调用 fal 的 Nemotron 3.5 ASR 端点,然后返回文本。

4

复制或优化结果

阅读带标点的转录文本并复制,如果想在同一片段上比较精度与速度,可调整加速或输入。

延迟与精度

选择合适的加速级别

加速决定流式分块的大小。分块越小,延迟越低;分块越大,上下文越多,精度越好。

none约 1.12 秒分块

精度最佳。适用于最终转录稿、录音以及任何将要发布的内容。

regular约 0.56 秒分块

延迟与精度均衡——大多数演示片段的默认选择。

high约 0.32 秒分块

为交互式使用提供更快的响应,精度权衡更明显。

full约 0.08 秒分块

为实时字幕和语音代理提供最低延迟;预计精度权衡最大。

分块大小为近似值,遵循 NVIDIA 记录的配置。fal 目前显示的价格约为每分钟 0.008 美元;请查阅 fal 的 API 文档以了解当前的方案与费率。

应用场景

你可以用 Nemotron 3.5 ASR 构建什么

低延迟、多语言的语音识别适用于各类音频产品。

实时字幕与字幕轨

在延迟至关重要的会议、网络研讨会和直播中,将语音转换为可读、带标点的字幕。

语音代理与助手

为对话式 AI 提供低延迟转录,让助手在用户仍在说话时就能作出回应。

多语言转录

用单个模型在约 40 种语言区域上转录音频,无需管理按语言划分的检查点。

通话与会议分析

将通话和会议转换为可搜索、带标点的文本,用于质检、合规与摘要流水线。

媒体与播客工作流

为剪辑、节目笔记和片段发现起草转录稿,然后在完整的转录工作区中进行优化。

无障碍工具

为无障碍、记笔记和听写体验提供实时语音转文字。

当前的 fal 端点。 本演示使用 nvidia/nemotron-asr-multilingual/asr 端点进行托管的 Nemotron ASR 转录。提供方错误、超时或账户配置问题会在演示路由中退还积分。Nemotron 3.5 ASR 的权重在 Hugging Face 上开放以便自托管,你也可以随时在 Whisper AI 工作区 中进行转录。

常见问题

Nemotron 3.5 ASR 常见问题

关于 Nemotron、Nemotron AI 和 Nemotron 3.5 ASR 的常见问题。

什么是 Nemotron 3.5 ASR?

Nemotron 3.5 ASR 是 NVIDIA 开放的、拥有 6 亿参数的多语言流式语音识别(ASR)模型。它采用 Cache-Aware FastConformer-RNNT 架构实时将音频转录为文本,在单个检查点中覆盖约 40 种语言区域,并直接输出原生的标点与大小写。

什么是 Nemotron?

Nemotron 是 NVIDIA 的开放 AI 模型家族,以开放权重、训练数据和配方发布。该家族涵盖语言模型与语音模型,并以 NVIDIA NIM 微服务形式提供。Nemotron 3.5 ASR 是本页使用的语音识别成员。

在这里可以免费试用 Nemotron AI 吗?

运行演示需要一个免费的 Whisper AI 账户,每次转录消耗 1 个积分。新账户附带免费的起始积分,可立即试用 Nemotron,你也可以随时在定价页面充值。

Nemotron 3.5 ASR 支持多少种语言?

单个 0.6B 检查点借助语言 ID 提示条件支持约 40 种语言区域——约 36 种语言——因此你无需为每种语言准备单独的模型。

加速设置有什么作用?

加速控制流式分块的大小,从而决定延迟/精度的权衡。none 使用约 1.12 秒的分块以获得最佳精度;regular、high 和 full 使用逐渐更小的分块以降低延迟。

支持哪些音频格式和大小?

fal 为文件输入记录了 mp3、ogg、wav、m4a 和 aac,并接受 data URI。本演示将浏览器上传限制在约 10 MB;对于更长的文件,请将其托管并粘贴公开 URL。

我的音频是否私密?

你的 FAL_KEY 永远不会到达浏览器——请求都经由我们的服务器。音频本身会发送到 NVIDIA 托管在 fal 上的端点进行处理,因此请勿向公开演示上传机密录音。

为什么演示有时提示端点不可用?

演示依赖 fal 托管的 NVIDIA Nemotron ASR 端点、你的账户积分以及我们服务器端的 FAL_KEY 配置。如果提供方不可用或请求超时,演示会引导你前往 Whisper AI 工作区,让你仍能完成音频转录。

试用 Nemotron AI 语音转文字

上传片段、选择加速级别,几秒内即可读到带标点的转录文本——然后探索开放的 Nemotron 权重,构建你自己的流水线。

开放权重 · 0.6B 参数 · 约 40 种语言区域