開放權重情感 TTS · 即時 Demo

Miso One — 富有情感的 AI 文字轉語音

Miso Labs 的 MisoTTS 模型,在你的瀏覽器中即時執行

Miso One 是一個開放權重、約 80 億參數的文字轉語音模型,旨在讓聲音聽起來真正像人——溫暖、富有表現力且充滿情感。在下方輸入任意英文文字即可聆聽逼真的 AI 語音,或從一段簡短片段克隆聲音。

約 8B 參數一次性聲音克隆開放權重(修改版 MIT)英語在瀏覽器中執行
Miso One · MisoTTS 即時 Demo
在 Hugging Face 中開啟

該 Demo 是託管在 Hugging Face 上的官方 MisoTTS Space。首次產生可能會在 GPU 預熱時稍慢一些。Miso One 與 MisoTTS 是以下公司的產品: Miso Labs;本頁是一份獨立指南,內嵌了官方 Demo。

概覽

什麼是 Miso One?

Miso One 是 Miso Labs 推出的情感豐富的 AI 文字轉語音模型,Miso Labs 是一家受 Y Combinator 支援的語音 AI 新創公司。該模型於 2026 年 6 月初以技術名稱 MisoTTS 釋出,是一個約 80 億參數的語音合成模型,旨在讓 AI 聲音聽起來真正像人——在大多數文字轉語音仍顯平淡之處,帶來真實的溫暖、節奏與情感。

在底層,Miso One 將 Llama 3.2 風格的主幹與一個更小的自迴歸音訊解碼器配對——這是一個受 Sesame 的 CSM 架構啟發的 RVQ Transformer——並根據你的文字和可選的音訊上下文產生 Mimi 音訊編碼。它支援從約 10 秒的片段進行一次性聲音克隆,Miso Labs 以開放權重發布了它,方便開發者自行執行。

本頁頂部的互動面板就是官方的 MisoTTS Hugging Face Space,因此你現在就能將 Miso One 當作 AI 語音產生器來試用——無需安裝。

特性

Miso One 為何出眾

富有情感的表達、聲音克隆和開放權重,使 Miso One 成為一個強大且對開發者友好的文字轉語音模型。

真正富有情感的語音

Miso One 旨在像真人一樣朗讀——帶著溫暖、節奏與情感——而不是大多數文字轉語音仍在產生的平淡、機械的表達。

一次性聲音克隆

從約 10 秒的參考片段克隆一種聲音,然後讓 Miso One 用該聲音朗讀新的句子。請僅在獲得說話者同意的情況下使用克隆。

低延遲產生

Miso Labs 稱首個 token 的延遲約為 110 毫秒,可實現回應迅速的對話式播放。請將該數字視為廠商基準。

約 8B 參數架構

Llama 3.2 風格的主幹搭配一個更小的音訊解碼器——一個受 Sesame CSM 啟發的 RVQ Transformer——從文字產生 Mimi 音訊編碼。

開放權重,可自託管

以修改版 MIT 許可證、開放權重發布,因此你可以在本地執行 Miso One,將音訊和文字保留在自己的機器上。

為開發者打造

從 Hugging Face 拉取 MisoLabs/MisoTTS 權重並整合到你自己的技術棧中。Miso Labs 稱託管 API 即將推出。

富有表現力的英語聲音

Miso One 目前專注於自然的英語語音,帶有逼真的語調、重音和遵循你標點的措辭。

感知語氣的輸出

該模型同時基於你的文字和可選的音訊上下文進行條件化,因此表達可以契合你想要的情緒與能量。

如何使用

四步用 Miso One 產生語音

一切都在上方內嵌的 Demo 中完成——無需帳戶或任何設定即可開始。

1

輸入或貼上你的文字

在上方的 Miso One Demo 中輸入你想朗讀的英文文字。標點和自然的措辭會引導情感與節奏。

2

新增參考聲音(可選)

如果你希望 Miso One 為輸出克隆特定的聲音,請提供一段簡短、乾淨的參考片段——約 10 秒。

3

調整並產生

使用 Demo 提供的任何表現力或長度控制元件,然後產生。首次執行在 Hugging Face Space 預熱時可能較慢。

4

播放、下載或自託管

聆聽並下載產生的音訊。對於生產用途,請自行執行開放的 MisoTTS 權重,讓你的資料永不離開你的基礎設施。

應用場景

你可以用 Miso One 建構什麼

富有情感的 AI 語音適用於各類語音與音訊產品。

配音與旁白

為講解影片、廣告和社群影片製作富有表現力的旁白,無需預訂錄音室。

對話式語音代理

憑藉低延遲、富有情感的表達,為助手、IVR 和支援機器人賦予聽起來像人的聲音。

有聲書與線上教育

將長篇指令碼和課程轉換為聽感自然的語音,節奏與語氣保持一致。

遊戲與角色對白

使用一次性聲音克隆,以獨特、富有情感的聲音為角色台詞製作原型或正式上線。

無障礙

用更易於、更悅耳聆聽的聲音朗讀文章、文件和介面。

播客與內容創作

起草開場白、廣告口白和片段,或為可重複的內容產生一致的聲音。

提示

獲得更好結果的提示

  • 按你希望被朗讀的方式書寫——逗號、句號和換行會塑造 Miso One 的節奏與重音。
  • 進行聲音克隆時,使用乾淨、約 10 秒的單聲道片段,儘量減少背景噪音以獲得最佳匹配。
  • 將長指令碼拆分為自然的句子;逐段產生,而不是一個巨大的整塊。
  • 首次產生在 ZeroGPU Space 啟動時可能較慢——之後的執行會更快。
  • 請勿將敏感或私密文字貼上到公開 Demo 中。對於機密工作,請自託管開放權重。
常見問題

Miso One 常見問題

關於 Miso One、MisoTTS 和 Miso Labs 的常見問題。

什麼是 Miso One?

Miso One 是 Miso Labs 推出的開放權重、情感豐富的 AI 文字轉語音(TTS)模型。它能從文字產生逼真、富有表現力的英語語音,並可從一段簡短的參考片段克隆聲音。上方的互動面板就是執行在 Hugging Face 上的官方 MisoTTS Demo。

Miso One 和 MisoTTS 是一回事嗎?

是的。“Miso One”是產品名稱,“MisoTTS”是同一模型的開源釋出與程式碼倉庫名稱。你會在 GitHub 專案以及 Hugging Face 的模型和 Space 上看到 MisoTTS 這個名稱。

誰創造了 Miso One?

Miso One 由 Miso Labs 打造,這是一家受 Y Combinator 支援、專注於情感語音 AI 的新創公司。它於 2026 年 6 月初以開放權重發布。

Miso One 是免費且開源的嗎?

上方的 Demo 可在瀏覽器中免費試用,Miso Labs 以修改版 MIT 許可證、開放權重發布了該模型。在商業使用前,請在官方倉庫中查閱確切的許可條款。

Miso One 支援哪些語言?

Miso One 目前專注於英語。其他語言在釋出時未被記錄為受支援。

Miso One 能克隆聲音嗎?

可以。Miso Labs 描述了從約 10 秒參考片段進行的一次性聲音克隆。請僅克隆你有權使用的聲音,並遵守適用的法律和平臺規則。

模型有多大、速度有多快?

Miso One 被描述為約 80 億參數的模型(Llama 3.2 風格的主幹加一個音訊解碼器)。Miso Labs 稱首個 token 的延遲約為 110 毫秒;該數字是廠商宣告,而非獨立基準。

我的資料是否保持私密?

由於權重是開放的,你可以自託管 Miso One,將音訊和文字完全保留在自己的機器上。上方託管的 Demo 執行在 Hugging Face 上,因此請勿將機密內容貼上其中。

親耳聽聽 Miso One

輸入一句話、選擇一種聲音,幾秒內即可聆聽富有情感的 AI 語音——然後探索開放權重,用 MisoTTS 進行建構。