OmniVoice — 支援 600+ 語言的聲音克隆 TTS
k2-fsa 出品的多語言 zero-shot 文字轉語音模型,執行於官方 Hugging Face Space
OmniVoice 可將文字轉換為數百種語言的自然語音,支援基於授權、來自短參考片段的聲音克隆,並允許你透過年齡、音高、口音和耳語風格等屬性來設計聲音。先在下方的即時 Demo 中試用,再決定是否安裝。
這是託管在 Hugging Face 上的官方 OmniVoice Space,由 k2-fsa 建構。首次執行時 ZeroGPU 啟動較慢,可能需要稍等。本 Whisper AI 頁面是一份獨立指南,內嵌官方 Demo。
什麼是 OmniVoice?
OmniVoice 是 k2-fsa 專案推出的大規模多語言 zero-shot 文字轉語音模型。它不侷限於少數固定聲音,而是追求開源 TTS 模型中最廣的語言覆蓋,將來自數秒參考音訊的聲音克隆,與僅憑屬性即可建構說話人的語音設計控制結合在一起。
在底層,OmniVoice 基於 Qwen3-0.6B 與擴散式語言模型架構,團隊藉此在不犧牲品質的前提下提升推理速度——模型卡顯示即時率(RTF)低至 0.025,約為即時速度的 40 倍。此次釋出涵蓋 Hugging Face 模型與 Space、一篇 arXiv 論文、一個 GitHub 儲存庫、一個 Colab 筆記本,以及可透過 pip 安裝的 omnivoice 套件。
如果你在尋找 OmniVoice Demo,上方內嵌的 Space 是最快的途徑:輸入文字、選擇語言、需要克隆時上傳一段短音訊、調整產生設定,即可在瀏覽器中直接收聽 24 kHz 的 AI 語音。
OmniVoice 為何與眾不同
OmniVoice 在一個開源模型工作流程中融合了多語言語音產生、聲音克隆和語音設計。
大規模多語言 TTS
OmniVoice 追求極廣的語言覆蓋;官方模型卡為文字轉語音列出了 600 多個語言和方言程式碼。
zero-shot 聲音克隆
上傳一段簡短的參考錄音,OmniVoice 即可以相近的聲音風格朗讀新文字。乾淨的片段加上可選的文字稿能帶來最佳匹配。
無需參考的語音設計
沒有錄音?可基於性別、年齡、音高、耳語風格、英語口音或中文方言等屬性建構合成聲音。
快速的擴散式產生
OmniVoice 採用擴散式語言模型架構;模型卡顯示即時率(RTF)低至 0.025,約為即時速度的 40 倍。
基於 Qwen3 的開源模型
該模型基於 Qwen3-0.6B,並以 Hugging Face 模型與 Space、可透過 pip 安裝的套件,以及公開的 GitHub 儲存庫形式釋出。
負責任的語音保護
官方說明禁止未經授權的克隆、冒充和非法用途。僅在獲得說話人許可時才克隆其聲音。
四步試用 OmniVoice
託管的 Space 讓你無需本地設定即可使用 OmniVoice 的主要控制項。
選擇模式
開啟內嵌的 OmniVoice Demo:有參考錄音就選 Voice Clone,想從屬性建構說話人就選 Voice Design。
輸入文字與語言
貼上要合成的文字。可將語言保持為自動偵測,或在多語言下拉選單中選擇特定語言。
新增聲音上下文或設計設定
克隆時,上傳一段簡短乾淨的樣本,並可選附上其文字稿。設計時,設定年齡、音高、口音或耳語風格等屬性。
調整產生並收聽
調整速度、時長、推理步數、guidance 和 denoise 等設定,然後產生並播放 24 kHz 音訊輸出。
OmniVoice 能力一覽
來自公開 Hugging Face Space、模型卡和 Demo 介面的關鍵資訊,已在此重寫以便快速評估。
你可以用 OmniVoice 做什麼
當語音專案既需要多語言廣度,又需要靈活的說話人控制時,OmniVoice 尤其有用。
本地化與配音
為產品影片、課程、旁白和多語言創意工作快速產生多語言的草稿配音。
語音智慧體原型
在搭建生產級對話式 AI 或電話客服之前,先測試聲音個性、口音和節奏。
無障礙音訊內容
將文章、文件和學習資料轉為語音,服務更願意收聽或需要音訊替代方案的人群。
角色與風格探索
用語音設計探索年齡、音高、耳語以及口音或方言選項,而無需為每個變體錄製參考聲音。
研究與評測
將 zero-shot 克隆、多語言發音和可控說話人屬性與你自己的 TTS 基線進行對比。
開發者實驗
安裝 omnivoice 套件或使用 GitHub 程式碼,測試 Python 推理、批次產生和自訂工作流程。
獲得更好 OmniVoice 效果的技巧
- 使用單一說話人、背景噪聲低、音量自然的乾淨參考錄音。
- 首次測試保持簡短,以便快速檢查發音、節奏和聲音相似度。
- 當自動偵測在短文字或混合語種文字上表現不佳時,手動選擇語言。
- 在沒有授權的情況下,優先使用語音設計產生合成人物,而不是克隆真實人物。
- 新增 [laughter] 等非語言提示,或用拼音、音素糾正難讀詞,以打磨成品。
- 不要把機密文字貼上到公開 Demo 中;安裝 omnivoice 套件,自行執行敏感任務。
OmniVoice 常見問題
為評估 OmniVoice 用於 AI 聲音克隆、多語言 TTS 和語音設計的使用者提供簡短解答。
什麼是 OmniVoice?
OmniVoice 是 k2-fsa 專案推出的大規模多語言 zero-shot 文字轉語音模型。它可以合成 600 多種語言的語音,從一段短參考片段克隆聲音,並根據說話人屬性設計聲音。
我可以免費線上試用 OmniVoice 嗎?
可以。上方面板內嵌了 Hugging Face 上的官方 OmniVoice Space,你無需先安裝 Python 套件即可在瀏覽器中試用即時 Demo。
OmniVoice 支援聲音克隆嗎?
支援。在 Voice Clone 模式下,OmniVoice 使用一段短參考音訊和可選的文字稿來引導產生的聲音。請僅克隆你擁有或獲得明確許可的聲音。
OmniVoice 的語音設計是什麼?
語音設計讓你設定性別、年齡、音高、耳語風格、英語口音或中文方言等說話人屬性,然後無需任何參考錄音即可產生聲音。
OmniVoice 支援多少種語言?
官方模型卡列出了 600 多個語言和方言程式碼,是開源 zero-shot TTS 模型中覆蓋最廣的之一。在投入生產前,請先在即時 Space 中測試你的目標語言。
OmniVoice 是開源的嗎?
OmniVoice 基於 Qwen3-0.6B,以 Apache-2.0 許可證釋出,配有 Hugging Face 模型與 Space、GitHub 儲存庫以及可透過 pip 安裝的 omnivoice 套件。商用前請查閱許可證。
託管的 OmniVoice Demo 是私密的嗎?
內嵌 Demo 由 Hugging Face 託管,而非 Whisper AI。請勿在公開 Space 中輸入敏感文字或音訊;如需處理機密內容,請安裝 omnivoice 套件並自行執行模型。
在瀏覽器中試用 OmniVoice
在官方 Hugging Face Demo 中產生多語言語音、在獲得授權的前提下測試聲音克隆,並探索語音設計控制。
