AI ses ve konuşma modelleri · dizin

AI Modelleri

Barındırdığımız ve belgelediğimiz AI ses ve konuşma modellerini keşfedin. Etkileşimli demoları deneyin, ardından her model için hazırlanan ayrıntılı kılavuzu inceleyin. Yeni modeller yayımlandıkça bu dizine eklenir.

Model koleksiyonu

Kullanılabilir AI modelleri

Her modelin canlı demo, yetenekler ve uygulamaya dönük, dürüst bir kılavuz içeren kendi sayfası vardır.

Konuşma Tanıma

Nemotron 3.5 ASR

NVIDIA'nın açık ağırlıklı, 0,6 milyar parametreli çok dilli akışlı konuşma tanıma modeli. Nemotron AI ses-metin dönüşümünü canlı deneyin; klip yükleyin veya URL yapıştırın ve noktalama işaretli transkripsiyon alın.

Akışlı ASRYaklaşık 40 yerel ayarAçık ağırlıklarSesten metne
İncele Nemotron 3.5 ASR
Metinden Ses

Seed Audio 1.0

ByteDance'in fal üzerinde sunulan Seed Audio 1.0 modeli; istemden, referans sesten veya görselden ses üretebilir. API isteğini yapılandırın ve sorumlu kullanım notlarını inceleyin.

Metinden sesReferans sesGörsel yönlendirmefal API
İncele Seed Audio 1.0
Metinden Konuşma

Miso One

Miso Labs'ın açık ağırlıklı ve son derece duygusal AI metinden konuşma modeli MisoTTS. Canlı demoyu deneyin, kısa bir klipten izinli bir sesi klonlayın ve doğal konuşmayı dinleyin.

Duygusal TTSSes klonlamaAçık ağırlıklarİngilizce
İncele Miso One
Çok Dilli Metinden Konuşma

OmniVoice

k2-fsa'nın 600'den fazla dil için çok dilli, zero-shot TTS modeli. Ses klonlama, ses tasarımı ve doğal AI konuşması için canlı Hugging Face demosunu deneyin.

600+ dilSes klonlamaSes tasarımıApache-2.0
İncele OmniVoice
Çok Dilli Metinden Konuşma

VoxCPM

OpenBMB'nin 30 dil, ses tasarımı, denetlenebilir ses klonlama ve 48 kHz konuşma sunan tokenizer kullanmayan VoxCPM2 TTS modeli. Resmî Hugging Face demosunu deneyin.

30 dilSes tasarımıSes klonlama48 kHz
İncele VoxCPM

Yeni modeller yakında

Bu dizine yeni AI ses ve konuşma modelleri ekliyoruz. Daha sonra tekrar bakın veya bugün Nemotron 3.5 ASR, Seed Audio 1.0, Miso One, OmniVoice ya da VoxCPM ile başlayın.