600+ 語言 TTS · 聲音克隆 · 即時 Demo

OmniVoice — 支援 600+ 語言的聲音克隆 TTS

k2-fsa 出品的多語言 zero-shot 文字轉語音模型,執行於官方 Hugging Face Space

OmniVoice 可將文字轉換為數百種語言的自然語音,支援基於授權、來自短參考片段的聲音克隆,並允許你透過年齡、音高、口音和耳語風格等屬性來設計聲音。先在下方的即時 Demo 中試用,再決定是否安裝。

600+ 語言zero-shot 聲音克隆語音設計控制Apache-2.0 許可證Hugging Face Space
OmniVoice · 官方 Hugging Face Space
在 Hugging Face 中開啟

這是託管在 Hugging Face 上的官方 OmniVoice Space,由 k2-fsa 建構。首次執行時 ZeroGPU 啟動較慢,可能需要稍等。本 Whisper AI 頁面是一份獨立指南,內嵌官方 Demo。

概覽

什麼是 OmniVoice?

OmniVoice 是 k2-fsa 專案推出的大規模多語言 zero-shot 文字轉語音模型。它不侷限於少數固定聲音,而是追求開源 TTS 模型中最廣的語言覆蓋,將來自數秒參考音訊的聲音克隆,與僅憑屬性即可建構說話人的語音設計控制結合在一起。

在底層,OmniVoice 基於 Qwen3-0.6B 與擴散式語言模型架構,團隊藉此在不犧牲品質的前提下提升推理速度——模型卡顯示即時率(RTF)低至 0.025,約為即時速度的 40 倍。此次釋出涵蓋 Hugging Face 模型與 Space、一篇 arXiv 論文、一個 GitHub 儲存庫、一個 Colab 筆記本,以及可透過 pip 安裝的 omnivoice 套件。

如果你在尋找 OmniVoice Demo,上方內嵌的 Space 是最快的途徑:輸入文字、選擇語言、需要克隆時上傳一段短音訊、調整產生設定,即可在瀏覽器中直接收聽 24 kHz 的 AI 語音。

功能

OmniVoice 為何與眾不同

OmniVoice 在一個開源模型工作流程中融合了多語言語音產生、聲音克隆和語音設計。

大規模多語言 TTS

OmniVoice 追求極廣的語言覆蓋;官方模型卡為文字轉語音列出了 600 多個語言和方言程式碼。

zero-shot 聲音克隆

上傳一段簡短的參考錄音,OmniVoice 即可以相近的聲音風格朗讀新文字。乾淨的片段加上可選的文字稿能帶來最佳匹配。

無需參考的語音設計

沒有錄音?可基於性別、年齡、音高、耳語風格、英語口音或中文方言等屬性建構合成聲音。

快速的擴散式產生

OmniVoice 採用擴散式語言模型架構;模型卡顯示即時率(RTF)低至 0.025,約為即時速度的 40 倍。

基於 Qwen3 的開源模型

該模型基於 Qwen3-0.6B,並以 Hugging Face 模型與 Space、可透過 pip 安裝的套件,以及公開的 GitHub 儲存庫形式釋出。

負責任的語音保護

官方說明禁止未經授權的克隆、冒充和非法用途。僅在獲得說話人許可時才克隆其聲音。

使用方法

四步試用 OmniVoice

託管的 Space 讓你無需本地設定即可使用 OmniVoice 的主要控制項。

1

選擇模式

開啟內嵌的 OmniVoice Demo:有參考錄音就選 Voice Clone,想從屬性建構說話人就選 Voice Design。

2

輸入文字與語言

貼上要合成的文字。可將語言保持為自動偵測,或在多語言下拉選單中選擇特定語言。

3

新增聲音上下文或設計設定

克隆時,上傳一段簡短乾淨的樣本,並可選附上其文字稿。設計時,設定年齡、音高、口音或耳語風格等屬性。

4

調整產生並收聽

調整速度、時長、推理步數、guidance 和 denoise 等設定,然後產生並播放 24 kHz 音訊輸出。

模型詳情

OmniVoice 能力一覽

來自公開 Hugging Face Space、模型卡和 Demo 介面的關鍵資訊,已在此重寫以便快速評估。

核心任務
文字轉語音、zero-shot 聲音克隆與語音設計
語言覆蓋
模型卡列出 600+ 語言和方言程式碼
基礎模型
Qwen3-0.6B,採用擴散式語言模型架構
推理速度
模型卡顯示即時率(RTF)低至 0.025,約為即時速度的 40 倍
音訊與輸入
24 kHz 輸出;可選的短參考片段用於驅動聲音克隆
精細控制
支援 [laughter] 等非語言提示,以及透過拼音或音素進行發音糾正
許可證
據 Hugging Face 模型與 Space 後設資料為 Apache-2.0
應用場景

你可以用 OmniVoice 做什麼

當語音專案既需要多語言廣度,又需要靈活的說話人控制時,OmniVoice 尤其有用。

本地化與配音

為產品影片、課程、旁白和多語言創意工作快速產生多語言的草稿配音。

語音智慧體原型

在搭建生產級對話式 AI 或電話客服之前,先測試聲音個性、口音和節奏。

無障礙音訊內容

將文章、文件和學習資料轉為語音,服務更願意收聽或需要音訊替代方案的人群。

角色與風格探索

用語音設計探索年齡、音高、耳語以及口音或方言選項,而無需為每個變體錄製參考聲音。

研究與評測

將 zero-shot 克隆、多語言發音和可控說話人屬性與你自己的 TTS 基線進行對比。

開發者實驗

安裝 omnivoice 套件或使用 GitHub 程式碼,測試 Python 推理、批次產生和自訂工作流程。

最佳實踐

獲得更好 OmniVoice 效果的技巧

  • 使用單一說話人、背景噪聲低、音量自然的乾淨參考錄音。
  • 首次測試保持簡短,以便快速檢查發音、節奏和聲音相似度。
  • 當自動偵測在短文字或混合語種文字上表現不佳時,手動選擇語言。
  • 在沒有授權的情況下,優先使用語音設計產生合成人物,而不是克隆真實人物。
  • 新增 [laughter] 等非語言提示,或用拼音、音素糾正難讀詞,以打磨成品。
  • 不要把機密文字貼上到公開 Demo 中;安裝 omnivoice 套件,自行執行敏感任務。
常見問題

OmniVoice 常見問題

為評估 OmniVoice 用於 AI 聲音克隆、多語言 TTS 和語音設計的使用者提供簡短解答。

什麼是 OmniVoice?

OmniVoice 是 k2-fsa 專案推出的大規模多語言 zero-shot 文字轉語音模型。它可以合成 600 多種語言的語音,從一段短參考片段克隆聲音,並根據說話人屬性設計聲音。

我可以免費線上試用 OmniVoice 嗎?

可以。上方面板內嵌了 Hugging Face 上的官方 OmniVoice Space,你無需先安裝 Python 套件即可在瀏覽器中試用即時 Demo。

OmniVoice 支援聲音克隆嗎?

支援。在 Voice Clone 模式下,OmniVoice 使用一段短參考音訊和可選的文字稿來引導產生的聲音。請僅克隆你擁有或獲得明確許可的聲音。

OmniVoice 的語音設計是什麼?

語音設計讓你設定性別、年齡、音高、耳語風格、英語口音或中文方言等說話人屬性,然後無需任何參考錄音即可產生聲音。

OmniVoice 支援多少種語言?

官方模型卡列出了 600 多個語言和方言程式碼,是開源 zero-shot TTS 模型中覆蓋最廣的之一。在投入生產前,請先在即時 Space 中測試你的目標語言。

OmniVoice 是開源的嗎?

OmniVoice 基於 Qwen3-0.6B,以 Apache-2.0 許可證釋出,配有 Hugging Face 模型與 Space、GitHub 儲存庫以及可透過 pip 安裝的 omnivoice 套件。商用前請查閱許可證。

託管的 OmniVoice Demo 是私密的嗎?

內嵌 Demo 由 Hugging Face 託管,而非 Whisper AI。請勿在公開 Space 中輸入敏感文字或音訊;如需處理機密內容,請安裝 omnivoice 套件並自行執行模型。

在瀏覽器中試用 OmniVoice

在官方 Hugging Face Demo 中產生多語言語音、在獲得授權的前提下測試聲音克隆,並探索語音設計控制。