Açık ağırlıklar · duygusal TTS · canlı demo

Miso One — Duygusal AI Metinden Konuşmaya

Miso Labs'ın MisoTTS modeli, tarayıcınızda canlı olarak çalışıyor

Miso One; insana özgü sıcaklık, ifade ve duygu sunmak üzere tasarlanmış, açık ağırlıklı, yaklaşık 8 milyar parametreli bir metinden konuşma modelidir. Aşağıya İngilizce metin yazıp gerçekçi AI konuşmasını dinleyin veya kısa bir klipten izinli bir sesi klonlayın.

~8B parametreTek seferde ses klonlamaAçık ağırlıklar (değiştirilmiş MIT)İngilizceTarayıcınızda çalışır
Miso One · MisoTTS canlı demosu
Hugging Face'de aç

Demo, Hugging Face'de barındırılan resmî MisoTTS Space'idir. GPU hazırlanırken ilk ses üretimi biraz daha uzun sürebilir. Miso One ve MisoTTS, Miso Labs tarafından geliştirilmiştir; bu sayfa resmî demoyu içeren bağımsız bir kılavuzdur.

Genel Bakış

Miso One nedir?

Miso One, Y Combinator destekli ses yapay zekâsı girişimi Miso Labs'ın son derece duygusal metinden konuşma modelidir. Haziran 2026'nın başında MisoTTS teknik adıyla yayımlanan yaklaşık 8 milyar parametreli bu konuşma sentezi modeli, çoğu TTS sisteminin yetersiz kaldığı sıcaklık, tempo ve duyguyu yakalayarak AI seslerini daha insansı hâle getirmek için tasarlanmıştır.

Miso One, Llama 3.2 benzeri bir omurgayı Sesame'in CSM mimarisinden esinlenen daha küçük bir otoregresif ses kod çözücüyle, yani bir RVQ Transformer ile birleştirir. Metinden ve isteğe bağlı ses bağlamından Mimi ses kodları üretir. Yaklaşık 10 saniyelik bir klipten one-shot ses klonlamayı destekler; Miso Labs modeli geliştiricilerin kendi altyapılarında çalıştırabilmesi için açık ağırlıklarla yayımlamıştır.

Sayfanın üst kısmındaki etkileşimli panel, resmî MisoTTS Hugging Face Space'idir. Bu sayede Miso One'ı kurulum yapmadan hemen bir AI ses oluşturucu olarak deneyebilirsiniz.

Özellikler

Miso One neden öne çıkıyor?

Duygusal sunum, ses klonlama ve açık ağırlıklar Miso One'ı yetenekli, geliştirici dostu bir metinden konuşma modeli hâline getirir.

Gerçekten duygusal bir konuşma

Miso One, çoğu metinden konuşma teknolojisinin hâlâ ürettiği düz ve robotik aktarım yerine sıcaklık, tempo ve duyguyla gerçek bir insan gibi okumak üzere tasarlanmıştır.

Tek seferde ses klonlama

Yaklaşık 10 saniyelik bir referans klibinden izinli bir sesi klonlayın, ardından Miso One'ın yeni metni bu sesle okumasını sağlayın. Klonlamayı yalnızca konuşmacının izniyle kullanın.

Düşük gecikmeli üretim

Miso Labs, hızlı ve konuşma akışına uygun oynatma için ilk token gecikmesinin yaklaşık 110 ms olduğunu bildiriyor. Bu değeri bağımsız bir ölçüm değil, sağlayıcı kıyaslaması olarak değerlendirin.

~8B parametreli mimari

Llama 3.2 benzeri omurga, Sesame'in CSM mimarisinden esinlenen daha küçük bir RVQ Transformer ses kod çözücüsüyle birleştirilerek metinden Mimi ses kodları üretir.

Açık ağırlıklar, kendi altyapınızda barındırılabilir

Değiştirilmiş bir MIT lisansı altında açık ağırlıklarla piyasaya sürüldü; böylece Miso One'ı yerel olarak çalıştırabilir ve ses ve metninizi kendi makinenizde tutabilirsiniz.

Geliştiriciler için tasarlandı

MisoLabs/MisoTTS ağırlıklarını Hugging Face'den indirip kendi teknoloji yığınınıza entegre edin. Miso Labs ayrıca barındırılan bir API'nin yakında sunulacağını belirtiyor.

Etkileyici İngilizce sesler

Miso One, noktalama işaretlerinizi takip eden gerçekçi tonlama, vurgu ve ifadelerle günümüzün doğal İngilizce konuşmasına odaklanıyor.

Ton duyarlı çıktı

Model, hem metniniz hem de isteğe bağlı ses bağlamınız için koşullar sağlar, böylece sunum, hedeflediğiniz ruh hali ve enerjiyle eşleşebilir.

Nasıl kullanılır

Miso One ile dört adımda konuşma oluşturun

Her şey yukarıdaki yerleşik demoda gerçekleşir; başlamak için hesap veya kurulum gerekmez.

1

Metninizi yazın veya yapıştırın

Yukarıdaki Miso One demosuna seslendirilmesini istediğiniz İngilizce metni girin. Noktalama işaretleri ve doğal ifadeler duyguyu ve konuşma hızını yönlendirir.

2

Referans sesi ekleyin (isteğe bağlı)

Miso One'ın belirli bir sesle çıktı üretmesini istiyorsanız yaklaşık 10 saniyelik kısa ve temiz bir referans klibi sağlayın.

3

Ayarlayın ve oluşturun

Demonun ortaya çıkardığı ifade veya uzunluk kontrollerini kullanın ve ardından oluşturun. Hugging Face Space ısınırken ilk çalıştırma daha yavaş olabilir.

4

Oynatın, indirin veya kendi altyapınızda barındırın

Oluşturulan sesi dinleyin ve indirin. Üretimde kullanım için açık MisoTTS ağırlıklarını kendiniz çalıştırın, böylece verileriniz altyapınızdan asla ayrılmaz.

Kullanım durumları

Miso One ile yapabilecekleriniz

Duygusal AI konuşması, çok çeşitli sesli ürün ve içeriklerde kullanılabilir.

Seslendirme ve anlatım

Stüdyo oturumu rezervasyonu yapmadan açıklayıcılar, reklamlar ve sosyal videolar için etkileyici anlatımlar üretin.

Konuşmalı sesli aracılar

Düşük gecikmeli, duygusal sunumla asistanlara, IVR sistemlerine ve destek botlarına daha doğal bir konuşma sesi kazandırın.

Sesli kitaplar ve e-öğrenme

Uzun metinleri ve kurs içeriklerini tutarlı konuşma hızı ve tonla doğal duyulan sese dönüştürün.

Oyun ve karakter diyaloğu

Tek seferlik ses klonlamayı kullanarak farklı, duygusal seslere sahip karakter dizilerini prototipleyin veya gönderin.

Erişilebilirlik

Makaleleri, belgeleri ve kullanıcı arayüzünü, dinlenmesi daha kolay ve daha keyifli bir sesle yüksek sesle okuyun.

Podcast'ler ve içerik oluşturma

Taslak girişler, reklam seslendirmeleri ve bölümler oluşturun ya da düzenli içerikler için tutarlı bir ses kullanın.

İpuçları

Daha iyi sonuçlar için ipuçları

  • Söylenmesini istediğiniz şekilde yazın; virgüller, noktalar ve satır sonları Miso One'ın hızını ve vurgusunu şekillendirir.
  • Ses klonlama için, en iyi eşleşmeyi sağlamak amacıyla arka plan gürültüsünün minimum düzeyde olduğu, yaklaşık 10 saniyelik temiz bir mono klip kullanın.
  • Uzun senaryoları doğal cümlelere ayırın; tek bir büyük blok yerine bölüm bölüm oluşturun.
  • ZeroGPU Space başlatılırken ilk üretim yavaş olabilir; sonraki çalıştırmalar daha hızlıdır.
  • Herkese açık demoya hassas veya özel metin yapıştırmayın. Gizli çalışmalar için açık ağırlıkları kendiniz barındırın.
SSS

Miso One sık sorulan sorular

Miso One, MisoTTS ve Miso Labs hakkında sık sorulan sorular.

Miso One nedir?

Miso One, Miso Labs'ın açık ağırlıklı, son derece duygusal AI metinden konuşmaya (TTS) modelidir. Metinden gerçeğe yakın, etkileyici İngilizce konuşma üretir ve kısa bir referans klibinden ses kopyalayabilir. Yukarıdaki etkileşimli panel, Hugging Face üzerinde çalışan resmî MisoTTS demosudur.

Miso One, MisoTTS ile aynı mıdır?

Evet. “Miso One” ürün adıdır ve “MisoTTS” aynı modelin açık kaynak sürümü ve depo adıdır. GitHub projesinde, Hugging Face modelinde ve Space'te MisoTTS adını göreceksiniz.

Miso One'ı kim yarattı?

Miso One, duygusal ses AI'ye odaklanan Y Combinator destekli bir girişim olan Miso Labs tarafından oluşturuldu. Haziran 2026'nın başlarında açık ağırlıklarla piyasaya sürüldü.

Miso One ücretsiz ve açık kaynak mı?

Yukarıdaki demoyu tarayıcınızda denemek ücretsizdir ve Miso Labs, değiştirilmiş bir MIT lisansı altında açık ağırlıklara sahip modeli yayımladı. Ticari olarak kullanmadan önce resmî depodaki tam lisans koşullarını inceleyin.

Miso One hangi dilleri destekliyor?

Miso One bugün İngilizceye odaklanmıştır. Diğer dillerin lansman sırasında desteklendiği belgelenmemiştir.

Miso One bir sesi kopyalayabilir mi?

Evet. Miso Labs, kabaca 10 saniyelik bir referans klibinden tek seferlik ses klonlamayı anlatıyor. Yalnızca kullanma izniniz olan sesleri kopyalayın ve geçerli yasalara ve platform kurallarına uyun.

Model ne kadar büyük ve ne kadar hızlı?

Miso One, ~8 milyar parametreli bir model (Llama 3.2 tarzı omurga artı bir ses kod çözücü) olarak tanımlanıyor. Miso Labs, ilk belirteç gecikmesinin 110 ms civarında olduğunu bildiriyor; bu rakam bağımsız bir kıyaslama yerine satıcının iddiasıdır.

Verilerim gizli kalır mı?

Ağırlıklar açık olduğundan, Miso One'ı kendiniz barındırabilir ve ses ve metni tamamen kendi makinenizde tutabilirsiniz. Yukarıdaki barındırılan demo Hugging Face üzerinde çalışır, bu nedenle içine gizli içerik yapıştırmaktan kaçının.

Miso One'ı kendiniz duyun

Bir satır yazın, bir ses seçin ve saniyeler içinde duygusal AI konuşmasını dinleyin; ardından kendi MisoTTS uygulamanızı geliştirmek için açık ağırlıkları inceleyin.