NVIDIA açık model · akışlı konuşma tanıma

Nemotron 3.5 ASR — NVIDIA Konuşmadan Metne

Nemotron AI ses-metin dönüşümünü doğrudan tarayıcınızda deneyin

Nemotron, NVIDIA'nın açık model ailesidir; Nemotron 3.5 ASR ise bu ailenin 0,6 milyar parametreli çok dilli akışlı konuşma tanıma modelidir. Aşağıdan bir klip yükleyin veya ses URL'si yapıştırın ve saniyeler içinde noktalama işaretli transkripsiyon alın.

0,6B parametre~40 dil yerel ayarıCache-Aware FastConformer-RNNTAkışlı tanımaNoktalama işaretleri ve büyük harf kullanımı
Nemotron 3.5 ASR · canlı demo

Ana konuşulan dili bilmiyorsanız otomatik algılamayı kullanın.

Hızlandırma

Daha yüksek hızlandırma, daha düşük gecikme için daha küçük akış parçaları kullanır; hiçbiri seçeneği en iyi doğruluk için 1,12 saniyelik parçalar kullanırken tam seçeneği en düşük gecikme için 0,08 saniyelik parçalar kullanır.

Yeni hesaplara ücretsiz başlangıç kredisi verilir; her çalıştırmanın maliyeti 1 kredi.

Not: Bu demo, sesi sunucumuz üzerinden fal'da barındırılan NVIDIA Nemotron 3.5 ASR uç noktasına gönderir. Sağlayıcı kullanılamazsa sesinizi Whisper AI çalışma alanında güvenle transkribe edebilirsiniz.

Bu bağımsız bir kılavuzdur. Nemotron ve Nemotron 3.5 ASR, NVIDIA tarafından geliştirilmiştir. Demo, fal.ai tarafından barındırılan nvidia/nemotron-asr-multilingual/asr uç noktasında çalışır.

Genel Bakış

Nemotron 3.5 ASR nedir?

Nemotron 3.5 ASR, NVIDIA'nın 600 milyon parametreli, çok dilli akışlı konuşma tanıma modelidir. Açık ağırlıklar, eğitim verileri ve tariflerle birlikte piyasaya sürülen ve NVIDIA NIM mikro hizmetleri olarak sunulan Nemotron açık model ailesinin konuşma üyesidir.

Model, dil kimliği istemiyle koşullandırılan Cache-Aware FastConformer-RNNT mimarisini kullanır. Böylece tek bir checkpoint yaklaşık 40 dil-yerel ayarını destekler ve noktalama ile büyük harfleri doğrudan çıktıya ekler.

Bu sayfanın üst kısmındaki etkileşimli panel, Nemotron AI konuşmadan metne dönüşümünü hemen denemenizi sağlar. Barındırılan fal uç noktasını sunucumuzdan çağırdığı için API anahtarı gizli kalır; açık ağırlıkları ise Hugging Face'den indirip kendi altyapınızda çalıştırabilirsiniz.

Özellikler

Neden Nemotron 3.5 ASR öne çıkıyor?

Akışlı tanıma, kompakt çok dilli checkpoint ve çalışma zamanında ayarlanabilen gecikme, Nemotron'u pratik bir konuşmadan metne modeline dönüştürür.

Akış, düşük gecikmeli transkripsiyon

Nemotron 3.5 ASR, gerçek zamanlı akışlı tanıma için tasarlanmıştır. NVIDIA kısa parçalarda nihai sonuca ulaşma süresinin 100 ms'nin altında olduğunu bildirir. Bu değeri bağımsız bir ölçüm değil, sağlayıcı kıyaslaması olarak değerlendirin; mimari canlı altyazı ve sesli aracılara yöneliktir.

Cache-Aware FastConformer-RNNT

Model, RNNT kod çözücüyle birlikte Cache-Aware FastConformer kodlayıcı kullanır. Böylece her adımda önceden işlenmiş sesi yeniden hesaplamak yerine önbellekteki akış bağlamını verimli biçimde yeniden kullanır.

Tek checkpoint'te çok dilli destek

Tek bir 0,6 milyar parametreli checkpoint, dil kimliği istemiyle yaklaşık 40 dil-yerel ayarını, yani yaklaşık 36 dili kapsar; her dil için ayrı model kullanmanız gerekmez.

Yerel noktalama işaretleri ve büyük harf kullanımı

Transkriptler noktalama işaretleri ve büyük harflerle birlikte geri gelir, böylece çıktı ayrı bir restorasyon geçişi olmadan doğal olarak okunur.

Çalışma zamanında yapılandırılabilir gecikme

Hızlandırma ayarı aracılığıyla istek anında hız için doğruluktan ödün vermek üzere parça boyutları (yaklaşık 1,12 saniye, 0,56 saniye, 0,32 saniye ve 0,08 saniye) arasında geçiş yapın; yeniden konuşlandırmaya gerek yoktur.

Kompakt 0,6 milyar parametreli yapı

600 milyon parametreli model, yüksek eşzamanlılıkla sunulabilecek kadar kompakttır. NVIDIA, önbelleksiz yaklaşımlara göre daha yüksek GPU eşzamanlılığı bildirmektedir; üretim kapasitesi rakamlarını sağlayıcı beyanı olarak değerlendirin.

Açık Nemotron ailesinin bir parçası

Nemotron, NVIDIA'nın açık model ailesidir; açık ağırlıklar, eğitim verileri ve tariflerle birlikte yayımlanır ve kendi altyapınızda barındırmanız için NVIDIA NIM mikro hizmetleri olarak sunulur.

Fal API aracılığıyla sunucu tarafı

Bu sayfa, mevcut NVIDIA Nemotron ASR fal uç noktasını sunucu tarafında çağırır; böylece FAL_KEY'iniz gizli kalır ve tarayıcıya yalnızca transkript gönderilir.

Nasıl kullanılır

Nemotron ile dört adımda yazıya dönüştürün

Her şey yukarıdaki demoda gerçekleşiyor; başlamak için ücretsiz bir hesapla oturum açmanız yeterli. Her çalıştırmanın maliyeti 1 kredidir.

1

Sesinizi ekleyin

Kısa bir klip yükleyin (mp3, wav, ogg, m4a veya aac, en fazla 10 MB) ya da herkese açık bir ses URL'sini bu sayfanın üst kısmındaki Nemotron demosuna yapıştırın.

2

Dili ve hızlandırmayı seçin

Dili otomatik algılamada bırakın veya desteklenen bir yerel ayar seçin, ardından istediğiniz doğruluk-gecikme dengesine bağlı olarak hiçbirini, normal, yüksek veya tam hızlandırmayı seçin.

3

Transkripsiyonu çalıştırın

Metne Yaz'a basın. İstek, anahtarınız gizli tutularak fal Nemotron 3.5 ASR uç noktasını çağıran ve ardından metni döndüren sunucumuza gönderilir.

4

Sonucu kopyalayın veya hassaslaştırın

Noktalama işaretli metni inceleyip kopyalayın. Aynı klipte doğruluk ile gecikmeyi karşılaştırmak için hızlandırma düzeyini veya girdiyi değiştirin.

Gecikme ve doğruluk

Bir hızlandırma düzeyi seçin

Hızlandırma, akış parçası boyutunu ayarlar. Daha küçük parçalar daha düşük gecikme; daha büyük parçalar ise daha fazla bağlam ve daha yüksek doğruluk sağlar.

hiçbiri~1,12 saniyelik parçalar

En iyi doğruluk. Son transkriptler, kayıtlar ve yayınlayacağınız her şey için kullanın.

dengeli~0,56s parçalar

Dengeli gecikme ve doğruluk — çoğu demo klibi için varsayılan seçim.

yüksek~0,32 saniyelik parçalar

Daha net bir doğruluk dengesiyle etkileşimli kullanım için daha hızlı yanıtlar.

tam~0,08s parçalar

Canlı altyazı ve sesli aracılar için en düşük gecikme; doğruluktaki en belirgin değişim bu düzeyde görülür.

Parça boyutları yaklaşıktır ve NVIDIA'nın belgelenen konfigürasyonlarına uygundur. fal.ai şu anda dakika başına yaklaşık $0.008 fiyat gösteriyor; mevcut şema ve oranlar için fal.ai API belgelerine bakın.

Kullanım durumları

Nemotron 3.5 ASR ile yapabilecekleriniz

Düşük gecikmeli, çok dilli konuşma tanıma çok çeşitli ses ürünlerinde kullanılabilir.

Canlı altyazılar

Gecikmenin önemli olduğu toplantılar, web seminerleri ve yayınlardaki konuşmaları okunabilir, noktalama işaretli canlı altyazılara dönüştürün.

Ses aracıları ve asistanlar

Düşük gecikmeli transkriptleri konuşmaya dayalı AI'ye besleyin, böylece asistanlar kullanıcı konuşurken yanıt verebilir.

Çok dilli transkripsiyon

Her dil için ayrı model yönetmeden, tek bir modelle yaklaşık 40 dil-yerel ayarında sesi yazıya dökün.

Çağrı ve toplantı analitiği

Aramaları ve toplantıları QA, uyumluluk ve özetleme hatları için aranabilir, noktalama işaretli metne dönüştürün.

Medya ve podcast iş akışları

Düzenleme için taslak transkriptler ve program notları oluşturun, kullanılacak klipleri bulun, ardından sonuçları tam transkripsiyon çalışma alanında iyileştirin.

Erişilebilirlik araçları

Erişilebilirlik, not alma ve dikte deneyimleri için gerçek zamanlı konuşmayı metne dönüştürme olanağı sağlayın.

Geçerli fal uç noktası Bu demo, barındırılan Nemotron ASR transkripsiyonu için nvidia/nemotron-asr-multilingual/asr uç noktasını kullanır. Sağlayıcı hataları, zaman aşımları veya hesap yapılandırma sorunlarında krediler demo rotası üzerinden iade edilir. Nemotron 3.5 ASR ağırlıkları kendi altyapınızda çalıştırmak için Hugging Face üzerinde açıktır; transkripsiyon için dilediğiniz zaman Whisper AI çalışma alanını kullanabilirsiniz.

SSS

Nemotron 3.5 ASR sık sorulan sorular

Nemotron, Nemotron AI ve Nemotron 3.5 ASR hakkında sık sorulan sorular.

Nemotron 3.5 ASR nedir?

Nemotron 3.5 ASR, NVIDIA'nın açık ağırlıklı, 0,6 milyar parametreli çok dilli akışlı konuşma tanıma (ASR) modelidir. Cache-Aware FastConformer-RNNT mimarisiyle sesi gerçek zamanlı olarak metne dönüştürür, tek bir checkpoint'te yaklaşık 40 dil-yerel ayarını kapsar ve noktalama ile büyük harfleri doğrudan üretir.

Nemotron nedir?

Nemotron, NVIDIA'nın açık ağırlıklar, eğitim verileri ve tariflerle birlikte piyasaya sürülen açık AI modelleri ailesidir. Aile, dil ve konuşma modellerini kapsar ve NVIDIA NIM mikro hizmetleri olarak gönderilir. Nemotron 3.5 ASR bu sayfada kullanılan konuşma tanıma üyesidir.

Nemotron AI'yi burada denemek ücretsiz mi?

Demoyu çalıştırmak için ücretsiz bir Whisper AI hesabına ihtiyacınız olacak ve her transkripsiyon 1 krediye mal olacak. Yeni hesaplar ücretsiz başlangıç kredileriyle birlikte gelir; böylece Nemotron'u hemen deneyebilir ve fiyatlandırma sayfasından istediğiniz zaman kredi yükleyebilirsiniz.

Nemotron 3.5 ASR kaç dili destekler?

Tek bir 0,6 milyar parametreli checkpoint, dil kimliği istemiyle yaklaşık 40 dil-yerel ayarını (yaklaşık 36 dil) destekler; böylece her dil için ayrı modele ihtiyaç duymazsınız.

Hızlandırma ayarı ne işe yarar?

Hızlandırma, akış parçası boyutunu ve dolayısıyla gecikme-doğruluk dengesini belirler. 'Yok' seçeneği en iyi doğruluk için yaklaşık 1,12 saniyelik parçalar kullanır; 'Dengeli', 'Yüksek' ve 'Tam' seçenekleri daha düşük gecikme için giderek küçülen parçalar kullanır.

Hangi ses formatları ve boyutları çalışıyor?

fal, dosya girdisi için mp3, ogg, wav, m4a ve aac biçimlerini; ayrıca data URI kullanımını belgeler. Bu demo tarayıcı yüklemelerini 10 MB ile sınırlar. Daha büyük dosyaları herkese açık bir yerde barındırıp URL'sini yapıştırın.

Sesim özel mi?

FAL_KEY'iniz asla tarayıcıya ulaşmaz; istekler sunucumuz üzerinden geçer. Sesin kendisi, işlenmek üzere fal.ai üzerindeki NVIDIA'nın barındırılan uç noktasına gönderilir; bu nedenle, gizli kayıtları genel demoya yüklemekten kaçının.

Demo neden bazen uç noktanın kullanılamadığını söylüyor?

Demo, fal.ai'nin barındırılan NVIDIA Nemotron ASR uç noktasına, hesap kredilerinize ve sunucu tarafı FAL_KEY yapılandırmamıza bağlıdır. Sağlayıcı kullanılamıyorsa veya istek zaman aşımına uğrarsa demo sizi Whisper AI çalışma alanına bağlar, böylece sesinizi yine de yazıya dökebilirsiniz.

Nemotron AI konuşmayı metne dönüştürmeyi deneyin

Bir klip yükleyin, bir hızlanma düzeyi seçin ve noktalama işaretli bir metni saniyeler içinde okuyun; ardından kendi işlem hattınızı oluşturmak için açık Nemotron ağırlıklarını keşfedin.

Açık ağırlıklar · 0,6 milyar parametre · ~40 dil yerel ayarı