Nemotron 3.5 ASR — Speech-to-Text NVIDIA en streaming
Prueba Nemotron AI para convertir audio en texto en tu navegador
Nemotron es la familia de modelos abiertos de NVIDIA, y Nemotron 3.5 ASR es su modelo multilingüe de reconocimiento de voz en streaming con 0,6 mil millones de parámetros. Sube un clip o pega una URL de audio abajo para obtener, en segundos, una transcripción con puntuación.
Usa la detección automática a menos que sepas el idioma que se habla principalmente.
Una aceleración mayor usa segmentos de streaming más pequeños para reducir la latencia; none mantiene segmentos de 1,12 s para la mejor precisión, mientras que full usa segmentos de 0,08 s para la menor latencia.
para ejecutar la demo. Las cuentas nuevas reciben créditos iniciales gratuitos; después, cada ejecución cuesta 1 crédito.
Atención: esta demo envía el audio al endpoint alojado de NVIDIA Nemotron 3.5 ASR en fal a través de nuestro servidor. Si el proveedor no está disponible, tu audio se puede transcribir de forma segura en el workspace de Whisper AI.
Esta es una guía independiente. Nemotron y Nemotron 3.5 ASR son productos de NVIDIA; la demo se ejecuta a través del endpoint fal alojado nvidia/nemotron-asr-multilingual/asr .
¿Qué es Nemotron 3.5 ASR?
Nemotron 3.5 ASR es un modelo multilingüe de reconocimiento de voz en streaming de NVIDIA, con 600 millones de parámetros. Forma parte de la familia abierta Nemotron, lanzada con pesos, datos de entrenamiento y recetas abiertos, y también disponible como microservicios NVIDIA NIM.
Internamente, usa una arquitectura Cache-Aware FastConformer-RNNT con condicionamiento mediante un prompt de identificación de idioma. Así, un único checkpoint cubre alrededor de 40 configuraciones regionales de idioma y genera directamente puntuación y mayúsculas nativas.
El panel interactivo en la parte superior de esta página te permite probar ahora mismo Nemotron AI para speech-to-text. La llamada pasa por el lado del servidor a través del endpoint fal alojado, para mantener privada la clave de API, mientras que los pesos abiertos siguen disponibles en Hugging Face para el autoalojamiento.
Por qué destaca Nemotron 3.5 ASR
El reconocimiento en streaming, un checkpoint multilingüe compacto y una latencia ajustable en tiempo de ejecución hacen de Nemotron un modelo speech-to-text práctico.
Transcripción en streaming de baja latencia
Nemotron 3.5 ASR está hecho para el reconocimiento en streaming en tiempo real. NVIDIA reporta un time-to-final por debajo de 100 ms en segmentos cortos; trata el número como un benchmark del proveedor, pero la arquitectura apunta claramente a subtítulos en vivo y agentes de voz.
Cache-Aware FastConformer-RNNT
El modelo combina un encoder FastConformer con reconocimiento de caché y un decoder RNNT, reutilizando el contexto de streaming de forma eficiente en lugar de reprocesar el audio en búfer en cada paso.
Multilingüe en un único checkpoint
Un único checkpoint de 0,6B cubre alrededor de 40 configuraciones regionales de idioma (aproximadamente 36 idiomas) con condicionamiento por ID de idioma, sin necesidad de cambiar de modelo para cada idioma.
Puntuación y mayúsculas nativas
Las transcripciones vuelven ya con puntuación y mayúsculas, de modo que el texto queda naturalmente legible sin un paso aparte de restauración.
Latencia configurable en tiempo de ejecución
Alterna entre segmentos de alrededor de 1,12 s, 0,56 s, 0,32 s y 0,08 s para equilibrar precisión y velocidad en cada solicitud, sin necesidad de volver a desplegar.
Huella compacta de 0,6B
Con 600 millones de parámetros, el modelo es lo bastante pequeño como para servir con alta concurrencia. NVIDIA cita una concurrencia de GPU mucho mayor que los enfoques en búfer; trata las cifras de throughput como datos del proveedor.
Parte de la familia abierta Nemotron
Nemotron es la familia de modelos abiertos de NVIDIA: lanzada con pesos, datos de entrenamiento y recetas abiertos, y disponible como microservicios NVIDIA NIM para el autoalojamiento.
Del lado del servidor a través de la API de fal
Esta página llama al endpoint fal actual de NVIDIA Nemotron ASR en el lado del servidor, para que tu FAL_KEY permanezca privada y el navegador reciba solo la transcripción.
Transcribe con Nemotron en cuatro pasos
Todo ocurre en la demo de arriba: solo inicia sesión con una cuenta gratuita para empezar. Cada ejecución cuesta 1 crédito.
Añade tu audio
Sube un clip corto (mp3, wav, ogg, m4a o aac, hasta 10 MB) o pega una URL pública de audio en la demo de Nemotron en la parte superior de esta página.
Elige idioma y aceleración
Deja el idioma en detección automática o elige una configuración regional compatible y, a continuación, selecciona none, regular, high o full según el equilibrio entre precisión y latencia que prefieras.
Ejecuta la transcripción
Haz clic en Transcribir. La solicitud se envía a nuestro servidor, que llama al endpoint fal de Nemotron 3.5 ASR con la clave mantenida privada y devuelve el texto.
Copia o refina el resultado
Lee la transcripción con puntuación, cópiala y ajusta la aceleración o la entrada si quieres comparar precisión y velocidad en el mismo clip.
Elegir el nivel de aceleración adecuado
La aceleración define el tamaño del segmento de streaming. Los segmentos más pequeños implican menor latencia; los más grandes ofrecen más contexto y mejor precisión.
Mejor precisión. Ideal para transcripciones finales, grabaciones y contenidos que se van a publicar.
Equilibrio entre latencia y precisión: la opción predeterminada para la mayoría de los clips de demostración.
Respuestas más rápidas para uso interactivo, con un compromiso de precisión más perceptible.
Latencia mínima para subtítulos en vivo y agentes de voz; espera el mayor compromiso de precisión.
Los tamaños de segmento son aproximados y siguen las configuraciones documentadas por NVIDIA. fal muestra actualmente un precio de alrededor de 0,008 US$ por minuto; consulta la documentación de la API de fal para conocer el esquema y los precios actuales.
Qué puedes crear con Nemotron 3.5 ASR
El reconocimiento de voz multilingüe de baja latencia encaja en una amplia variedad de productos de audio.
Subtítulos y captions en vivo
Convierte el habla en subtítulos legibles y con puntuación para reuniones, webinars y transmisiones donde la latencia importa.
Agentes de voz y asistentes
Alimenta una IA conversacional con transcripciones de baja latencia para que los asistentes respondan mientras el usuario todavía habla.
Transcripción multilingüe
Transcribe audio en alrededor de 40 configuraciones regionales de idioma desde un único modelo, sin necesidad de gestionar checkpoints por idioma.
Análisis de llamadas y reuniones
Convierte llamadas y reuniones en texto buscable y con puntuación para pipelines de calidad, cumplimiento y resumen.
Flujos de medios y podcasts
Crea borradores de transcripción para edición, notas de episodio y descubrimiento de fragmentos, y refínalos después en un workspace de transcripción completo.
Herramientas de accesibilidad
Ofrece speech-to-text en tiempo real para accesibilidad, anotaciones y experiencias de dictado.
Endpoint fal actual. Esta demo usa el nvidia/nemotron-asr-multilingual/asr para la transcripción Nemotron ASR alojada. Los errores del proveedor, los tiempos de espera o los problemas de configuración de la cuenta se reembolsan en la ruta de la demo. Los pesos de Nemotron 3.5 ASR son abiertos en Hugging Face para el autoalojamiento; también puedes transcribir en cualquier momento en el workspace de Whisper AI .
Preguntas frecuentes sobre Nemotron 3.5 ASR
Respuestas a las preguntas comunes sobre Nemotron, Nemotron AI y Nemotron 3.5 ASR.
¿Qué es Nemotron 3.5 ASR?
Nemotron 3.5 ASR es el modelo abierto, multilingüe y de reconocimiento de voz en streaming de NVIDIA, con 0,6 mil millones de parámetros. Transcribe audio en texto en tiempo real con una arquitectura Cache-Aware FastConformer-RNNT, cubre alrededor de 40 configuraciones regionales de idioma en un único checkpoint y genera directamente puntuación y mayúsculas.
¿Qué es Nemotron?
Nemotron es la familia de modelos de IA abiertos de NVIDIA, lanzada con pesos, datos de entrenamiento y recetas abiertos. La familia abarca modelos de lenguaje y de voz y se ofrece como microservicios NVIDIA NIM. Nemotron 3.5 ASR es el miembro de reconocimiento de voz que se usa en esta página.
¿Puedo probar Nemotron AI gratis aquí?
Necesitas una cuenta gratuita de Whisper AI para ejecutar la demo, y cada transcripción cuesta 1 crédito. Las cuentas nuevas reciben créditos iniciales gratuitos para probar Nemotron de inmediato, y puedes recargar en cualquier momento en la página de precios.
¿Cuántos idiomas admite Nemotron 3.5 ASR?
Un único checkpoint de 0,6B admite alrededor de 40 configuraciones regionales de idioma (aproximadamente 36 idiomas) usando condicionamiento mediante un prompt de identificación de idioma, así que no necesitas un modelo aparte por idioma.
¿Qué hace la configuración de aceleración?
La aceleración controla el tamaño del segmento de streaming y, por tanto, el compromiso entre latencia y precisión. none usa segmentos de alrededor de 1,12 s para la mejor precisión; regular, high y full usan segmentos cada vez más pequeños para reducir la latencia.
¿Qué formatos y tamaños de audio funcionan?
fal documenta mp3, ogg, wav, m4a y aac para la entrada de archivo, y se acepta un data URI. Esta demo limita los envíos desde el navegador a alrededor de 10 MB; para archivos más grandes, alójalos y pega una URL pública.
¿Es privado mi audio?
Tu FAL_KEY nunca llega al navegador: las solicitudes pasan por nuestro servidor. El audio en sí se envía al endpoint alojado de NVIDIA en fal para su procesamiento, así que evita enviar grabaciones confidenciales a la demo pública.
¿Por qué la demo dice a veces que el endpoint no está disponible?
La demo depende del endpoint NVIDIA Nemotron ASR alojado en fal, de los créditos de tu cuenta y de nuestra configuración de FAL_KEY en el lado del servidor. Si el proveedor no está disponible o una solicitud expira, la demo te dirige al workspace de Whisper AI para que sigas transcribiendo tu audio.
Prueba el speech-to-text de Nemotron AI
Sube un clip, elige un nivel de aceleración y lee una transcripción con puntuación en segundos; luego explora los pesos abiertos de Nemotron para construir tu propio pipeline.
Pesos abiertos · 0,6 mil M de parámetros · ~40 configuraciones regionales de idioma
