Nemotron 3.5 ASR — NVIDIA Konuşmadan Metne
Nemotron AI ses-metin dönüşümünü doğrudan tarayıcınızda deneyin
Nemotron, NVIDIA'nın açık model ailesidir; Nemotron 3.5 ASR ise bu ailenin 0,6 milyar parametreli çok dilli akışlı konuşma tanıma modelidir. Aşağıdan bir klip yükleyin veya ses URL'si yapıştırın ve saniyeler içinde noktalama işaretli transkripsiyon alın.
Ana konuşulan dili bilmiyorsanız otomatik algılamayı kullanın.
Daha yüksek hızlandırma, daha düşük gecikme için daha küçük akış parçaları kullanır; hiçbiri seçeneği en iyi doğruluk için 1,12 saniyelik parçalar kullanırken tam seçeneği en düşük gecikme için 0,08 saniyelik parçalar kullanır.
Yeni hesaplara ücretsiz başlangıç kredisi verilir; her çalıştırmanın maliyeti 1 kredi.
Not: Bu demo, sesi sunucumuz üzerinden fal'da barındırılan NVIDIA Nemotron 3.5 ASR uç noktasına gönderir. Sağlayıcı kullanılamazsa sesinizi Whisper AI çalışma alanında güvenle transkribe edebilirsiniz.
Bu bağımsız bir kılavuzdur. Nemotron ve Nemotron 3.5 ASR, NVIDIA tarafından geliştirilmiştir. Demo, fal.ai tarafından barındırılan nvidia/nemotron-asr-multilingual/asr uç noktasında çalışır.
Nemotron 3.5 ASR nedir?
Nemotron 3.5 ASR, NVIDIA'nın 600 milyon parametreli, çok dilli akışlı konuşma tanıma modelidir. Açık ağırlıklar, eğitim verileri ve tariflerle birlikte piyasaya sürülen ve NVIDIA NIM mikro hizmetleri olarak sunulan Nemotron açık model ailesinin konuşma üyesidir.
Model, dil kimliği istemiyle koşullandırılan Cache-Aware FastConformer-RNNT mimarisini kullanır. Böylece tek bir checkpoint yaklaşık 40 dil-yerel ayarını destekler ve noktalama ile büyük harfleri doğrudan çıktıya ekler.
Bu sayfanın üst kısmındaki etkileşimli panel, Nemotron AI konuşmadan metne dönüşümünü hemen denemenizi sağlar. Barındırılan fal uç noktasını sunucumuzdan çağırdığı için API anahtarı gizli kalır; açık ağırlıkları ise Hugging Face'den indirip kendi altyapınızda çalıştırabilirsiniz.
Neden Nemotron 3.5 ASR öne çıkıyor?
Akışlı tanıma, kompakt çok dilli checkpoint ve çalışma zamanında ayarlanabilen gecikme, Nemotron'u pratik bir konuşmadan metne modeline dönüştürür.
Akış, düşük gecikmeli transkripsiyon
Nemotron 3.5 ASR, gerçek zamanlı akışlı tanıma için tasarlanmıştır. NVIDIA kısa parçalarda nihai sonuca ulaşma süresinin 100 ms'nin altında olduğunu bildirir. Bu değeri bağımsız bir ölçüm değil, sağlayıcı kıyaslaması olarak değerlendirin; mimari canlı altyazı ve sesli aracılara yöneliktir.
Cache-Aware FastConformer-RNNT
Model, RNNT kod çözücüyle birlikte Cache-Aware FastConformer kodlayıcı kullanır. Böylece her adımda önceden işlenmiş sesi yeniden hesaplamak yerine önbellekteki akış bağlamını verimli biçimde yeniden kullanır.
Tek checkpoint'te çok dilli destek
Tek bir 0,6 milyar parametreli checkpoint, dil kimliği istemiyle yaklaşık 40 dil-yerel ayarını, yani yaklaşık 36 dili kapsar; her dil için ayrı model kullanmanız gerekmez.
Yerel noktalama işaretleri ve büyük harf kullanımı
Transkriptler noktalama işaretleri ve büyük harflerle birlikte geri gelir, böylece çıktı ayrı bir restorasyon geçişi olmadan doğal olarak okunur.
Çalışma zamanında yapılandırılabilir gecikme
Hızlandırma ayarı aracılığıyla istek anında hız için doğruluktan ödün vermek üzere parça boyutları (yaklaşık 1,12 saniye, 0,56 saniye, 0,32 saniye ve 0,08 saniye) arasında geçiş yapın; yeniden konuşlandırmaya gerek yoktur.
Kompakt 0,6 milyar parametreli yapı
600 milyon parametreli model, yüksek eşzamanlılıkla sunulabilecek kadar kompakttır. NVIDIA, önbelleksiz yaklaşımlara göre daha yüksek GPU eşzamanlılığı bildirmektedir; üretim kapasitesi rakamlarını sağlayıcı beyanı olarak değerlendirin.
Açık Nemotron ailesinin bir parçası
Nemotron, NVIDIA'nın açık model ailesidir; açık ağırlıklar, eğitim verileri ve tariflerle birlikte yayımlanır ve kendi altyapınızda barındırmanız için NVIDIA NIM mikro hizmetleri olarak sunulur.
Fal API aracılığıyla sunucu tarafı
Bu sayfa, mevcut NVIDIA Nemotron ASR fal uç noktasını sunucu tarafında çağırır; böylece FAL_KEY'iniz gizli kalır ve tarayıcıya yalnızca transkript gönderilir.
Nemotron ile dört adımda yazıya dönüştürün
Her şey yukarıdaki demoda gerçekleşiyor; başlamak için ücretsiz bir hesapla oturum açmanız yeterli. Her çalıştırmanın maliyeti 1 kredidir.
Sesinizi ekleyin
Kısa bir klip yükleyin (mp3, wav, ogg, m4a veya aac, en fazla 10 MB) ya da herkese açık bir ses URL'sini bu sayfanın üst kısmındaki Nemotron demosuna yapıştırın.
Dili ve hızlandırmayı seçin
Dili otomatik algılamada bırakın veya desteklenen bir yerel ayar seçin, ardından istediğiniz doğruluk-gecikme dengesine bağlı olarak hiçbirini, normal, yüksek veya tam hızlandırmayı seçin.
Transkripsiyonu çalıştırın
Metne Yaz'a basın. İstek, anahtarınız gizli tutularak fal Nemotron 3.5 ASR uç noktasını çağıran ve ardından metni döndüren sunucumuza gönderilir.
Sonucu kopyalayın veya hassaslaştırın
Noktalama işaretli metni inceleyip kopyalayın. Aynı klipte doğruluk ile gecikmeyi karşılaştırmak için hızlandırma düzeyini veya girdiyi değiştirin.
Bir hızlandırma düzeyi seçin
Hızlandırma, akış parçası boyutunu ayarlar. Daha küçük parçalar daha düşük gecikme; daha büyük parçalar ise daha fazla bağlam ve daha yüksek doğruluk sağlar.
En iyi doğruluk. Son transkriptler, kayıtlar ve yayınlayacağınız her şey için kullanın.
Dengeli gecikme ve doğruluk — çoğu demo klibi için varsayılan seçim.
Daha net bir doğruluk dengesiyle etkileşimli kullanım için daha hızlı yanıtlar.
Canlı altyazı ve sesli aracılar için en düşük gecikme; doğruluktaki en belirgin değişim bu düzeyde görülür.
Parça boyutları yaklaşıktır ve NVIDIA'nın belgelenen konfigürasyonlarına uygundur. fal.ai şu anda dakika başına yaklaşık $0.008 fiyat gösteriyor; mevcut şema ve oranlar için fal.ai API belgelerine bakın.
Nemotron 3.5 ASR ile yapabilecekleriniz
Düşük gecikmeli, çok dilli konuşma tanıma çok çeşitli ses ürünlerinde kullanılabilir.
Canlı altyazılar
Gecikmenin önemli olduğu toplantılar, web seminerleri ve yayınlardaki konuşmaları okunabilir, noktalama işaretli canlı altyazılara dönüştürün.
Ses aracıları ve asistanlar
Düşük gecikmeli transkriptleri konuşmaya dayalı AI'ye besleyin, böylece asistanlar kullanıcı konuşurken yanıt verebilir.
Çok dilli transkripsiyon
Her dil için ayrı model yönetmeden, tek bir modelle yaklaşık 40 dil-yerel ayarında sesi yazıya dökün.
Çağrı ve toplantı analitiği
Aramaları ve toplantıları QA, uyumluluk ve özetleme hatları için aranabilir, noktalama işaretli metne dönüştürün.
Medya ve podcast iş akışları
Düzenleme için taslak transkriptler ve program notları oluşturun, kullanılacak klipleri bulun, ardından sonuçları tam transkripsiyon çalışma alanında iyileştirin.
Erişilebilirlik araçları
Erişilebilirlik, not alma ve dikte deneyimleri için gerçek zamanlı konuşmayı metne dönüştürme olanağı sağlayın.
Geçerli fal uç noktası Bu demo, barındırılan Nemotron ASR transkripsiyonu için nvidia/nemotron-asr-multilingual/asr uç noktasını kullanır. Sağlayıcı hataları, zaman aşımları veya hesap yapılandırma sorunlarında krediler demo rotası üzerinden iade edilir. Nemotron 3.5 ASR ağırlıkları kendi altyapınızda çalıştırmak için Hugging Face üzerinde açıktır; transkripsiyon için dilediğiniz zaman Whisper AI çalışma alanını kullanabilirsiniz.
Nemotron 3.5 ASR sık sorulan sorular
Nemotron, Nemotron AI ve Nemotron 3.5 ASR hakkında sık sorulan sorular.
Nemotron 3.5 ASR nedir?
Nemotron 3.5 ASR, NVIDIA'nın açık ağırlıklı, 0,6 milyar parametreli çok dilli akışlı konuşma tanıma (ASR) modelidir. Cache-Aware FastConformer-RNNT mimarisiyle sesi gerçek zamanlı olarak metne dönüştürür, tek bir checkpoint'te yaklaşık 40 dil-yerel ayarını kapsar ve noktalama ile büyük harfleri doğrudan üretir.
Nemotron nedir?
Nemotron, NVIDIA'nın açık ağırlıklar, eğitim verileri ve tariflerle birlikte piyasaya sürülen açık AI modelleri ailesidir. Aile, dil ve konuşma modellerini kapsar ve NVIDIA NIM mikro hizmetleri olarak gönderilir. Nemotron 3.5 ASR bu sayfada kullanılan konuşma tanıma üyesidir.
Nemotron AI'yi burada denemek ücretsiz mi?
Demoyu çalıştırmak için ücretsiz bir Whisper AI hesabına ihtiyacınız olacak ve her transkripsiyon 1 krediye mal olacak. Yeni hesaplar ücretsiz başlangıç kredileriyle birlikte gelir; böylece Nemotron'u hemen deneyebilir ve fiyatlandırma sayfasından istediğiniz zaman kredi yükleyebilirsiniz.
Nemotron 3.5 ASR kaç dili destekler?
Tek bir 0,6 milyar parametreli checkpoint, dil kimliği istemiyle yaklaşık 40 dil-yerel ayarını (yaklaşık 36 dil) destekler; böylece her dil için ayrı modele ihtiyaç duymazsınız.
Hızlandırma ayarı ne işe yarar?
Hızlandırma, akış parçası boyutunu ve dolayısıyla gecikme-doğruluk dengesini belirler. 'Yok' seçeneği en iyi doğruluk için yaklaşık 1,12 saniyelik parçalar kullanır; 'Dengeli', 'Yüksek' ve 'Tam' seçenekleri daha düşük gecikme için giderek küçülen parçalar kullanır.
Hangi ses formatları ve boyutları çalışıyor?
fal, dosya girdisi için mp3, ogg, wav, m4a ve aac biçimlerini; ayrıca data URI kullanımını belgeler. Bu demo tarayıcı yüklemelerini 10 MB ile sınırlar. Daha büyük dosyaları herkese açık bir yerde barındırıp URL'sini yapıştırın.
Sesim özel mi?
FAL_KEY'iniz asla tarayıcıya ulaşmaz; istekler sunucumuz üzerinden geçer. Sesin kendisi, işlenmek üzere fal.ai üzerindeki NVIDIA'nın barındırılan uç noktasına gönderilir; bu nedenle, gizli kayıtları genel demoya yüklemekten kaçının.
Demo neden bazen uç noktanın kullanılamadığını söylüyor?
Demo, fal.ai'nin barındırılan NVIDIA Nemotron ASR uç noktasına, hesap kredilerinize ve sunucu tarafı FAL_KEY yapılandırmamıza bağlıdır. Sağlayıcı kullanılamıyorsa veya istek zaman aşımına uğrarsa demo sizi Whisper AI çalışma alanına bağlar, böylece sesinizi yine de yazıya dökebilirsiniz.
Nemotron AI konuşmayı metne dönüştürmeyi deneyin
Bir klip yükleyin, bir hızlanma düzeyi seçin ve noktalama işaretli bir metni saniyeler içinde okuyun; ardından kendi işlem hattınızı oluşturmak için açık Nemotron ağırlıklarını keşfedin.
Açık ağırlıklar · 0,6 milyar parametre · ~40 dil yerel ayarı
