VoxCPM2 · 30 種語言 TTS · 語音克隆

VoxCPM — Tokenizer-Free 多語言語音克隆 TTS

OpenBMB 的 VoxCPM2 模型,已嵌入官方 Hugging Face Space

線上體驗 VoxCPM 的多語言文字轉語音、自然語言音色設計、可控語音克隆和 48 kHz AI 語音輸出。本頁基於公開資料重新整理 VoxCPM2 資訊,並嵌入官方 Demo,便於搜尋和快速評估。

2B 參數30 種語言音色設計可控語音克隆48 kHz 輸出Apache-2.0
VoxCPM2 · 官方 Hugging Face Space
在 Hugging Face 開啟

這是由 OpenBMB在 Hugging Face 託管的官方 VoxCPM-Demo Space。首次執行可能需要等待服務喚醒。請不要在公開 Space 中提交機密文字或私人聲音樣本。

快速瞭解

VoxCPM 是什麼?

VoxCPM 是 OpenBMB 推出的開源文字轉語音模型族。目前的 VoxCPM2 版本面向自然的多語言語音、基於自然語言描述的音色設計,以及更接近真實說話人的語音克隆,同時避免依賴離散語音 token 的傳統流程。

根據公開的 VoxCPM2 model card 和專案技術文件,VoxCPM2 是一個 2B 參數的 tokenizer-free diffusion autoregressive TTS 模型,訓練資料規模超過 200 萬小時多語言語音。它支援 30 種語言,可使用短參考音訊做克隆,並透過 AudioVAE V2 輸出 48 kHz 語音。

頁面中的嵌入 Demo 適合快速評估:直接輸入多語言文字、用自然語言描述音色、上傳參考音訊做可控克隆,或提供參考音訊和轉錄文字進行更高保真的克隆測試。

核心特性

VoxCPM2 為什麼值得關注

VoxCPM 將多語言產生、音色設計、語音克隆和麵向部署的 serving 路徑放在一個開放模型工作流程中。

Tokenizer-free diffusion autoregressive TTS

VoxCPM2 透過 diffusion autoregressive 架構直接產生連續語音表示,而不是依賴離散語音 token。

覆蓋 30 種語言的多語言語音

公開 model card 列出 30 種支援語言,包括中文、英文、日文、韓文、西班牙文、法文、德文、葡萄牙文、印地語、阿拉伯語和越南語等。

用自然語言做音色設計

可以用性別、年齡、語氣、情緒、語速等描述想要的說話人,讓 VoxCPM2 在沒有參考音訊的情況下產生新的合成聲音。

可控和高保真語音克隆

上傳短參考音訊以保留音色,加入風格提示來控制表達,或提供參考文字以獲得更高保真的 continuation-style 克隆。

48 kHz 輸出和串流推理路徑

VoxCPM2 接受 16 kHz 參考音訊並輸出 48 kHz 語音;技術文件中也提到標準即時串流推理和更快的 Nano-vLLM serving。

開放且重視安全的釋出

公開發布採用 Apache-2.0,但專案明確禁止冒充、欺詐和虛假資訊傳播。使用 AI 產生音訊時應清晰標註。

使用方法

四步體驗 VoxCPM

託管的 Space 可以直接試用 VoxCPM2 的核心流程,無需本地安裝。

1

開啟 VoxCPM Space

使用上方嵌入的 Hugging Face Space,或在新標籤頁開啟。冷啟動時可能需要等待依賴和模型載入。

2

輸入支援語言的文字

先貼上一小段指令碼。VoxCPM2 面向多語言輸入設計,通常不需要額外語言標籤。

3

選擇音色設計或語音克隆

音色設計可以先寫一段說話人描述;語音克隆則上傳乾淨的參考音訊,並在需要改變節奏或情緒時加入風格提示。

4

調整產生參數並試聽

根據 Demo 控制元件調整推理步數、guidance、降噪或風格設定,先產生短樣本,再迭代發音、節奏和說話人風格。

模型資訊

VoxCPM 能力速覽

以下資訊來自 VoxCPM2 Hugging Face model card、Space 後設資料、技術文件和專案 Demo 頁,並已重新整理為便於評估的說明。

模型族
OpenBMB 的 VoxCPM / VoxCPM2
主要任務
多語言文字轉語音、音色設計、可控語音克隆和高保真克隆
架構
Tokenizer-free diffusion autoregressive TTS pipeline,技術文件中描述為 LocEnc → TSLM → RALM → LocDiT
規模和 backbone
2B 參數,基於 MiniCPM-4 backbone
訓練規模
公開 model card 中提到超過 200 萬小時多語言語音資料
語言覆蓋
30 種語言,並列出四川話、粵語、吳語、東北話等中文方言支援
音訊品質
接受 16 kHz 參考音訊,並透過 AudioVAE V2 輸出 48 kHz 語音
託管 Demo
官方 Gradio Space openbmb/VoxCPM-Demo,目前服務域名為 openbmb-voxcpm-demo.hf.space
許可證
VoxCPM2 模型和 Space 後設資料中標註 Apache-2.0
使用場景

可以用 VoxCPM 做什麼

當語音專案同時需要多語言覆蓋、表達可控和可自部署能力時,VoxCPM 會比較適合。

多語言產品旁白

在最終錄製真人配音前,為產品導覽、課程和解釋影片快速產生多語言旁白草稿。

語音 Agent 原型

在接入生產語音 Agent 棧前,先評估不同人設、語速、情緒和 48 kHz 輸出品質。

配音和本地化測試

用本地化指令碼測試發音、節奏和表現力,尤其適合傳統 TTS 覆蓋不足的語言。

獲得授權的語音克隆

只在獲得許可時克隆真實聲音,並用可控風格提示測試不同情緒或節奏,同時保留音色。

合成角色聲音探索

當你需要全新的虛擬角色或品牌安全聲音時,可用音色設計替代真實人物克隆。

開發者評估

將 VoxCPM 與其他開放 TTS 系統比較,測試 Python 套件,或研究 Nano-vLLM serving 的低延遲路徑。

最佳實踐

提升 VoxCPM 效果的建議

  • 先用短文字測試發音、節奏和音色一致性,再產生長文字。
  • 語音克隆建議使用乾淨、單人說話的參考音訊;噪聲或多人聲音會降低相似度判斷。
  • 如果音色設計不符合預期,用更具體的年齡、語速、情緒和聲音質感來改寫描述。
  • 進行高保真克隆時,如果 Demo 要求提供參考轉錄,儘量補充對應文字以保留原始表達。
  • 不要在公開 Space 中提交機密指令碼或私人聲音樣本;敏感生產場景建議自部署 VoxCPM2。
  • 不要將 VoxCPM 用於冒充、欺詐或未標註的合成媒體。克隆任何真實聲音前都應獲得明確授權。
FAQ

VoxCPM 常見問題

面向多語言 TTS、語音克隆、音色設計和自部署評估的簡短回答。

VoxCPM 是什麼?

VoxCPM 是 OpenBMB 的 tokenizer-free 文字轉語音模型族。VoxCPM2 是目前的 2B 參數版本,面向多語言語音產生、音色設計和語音克隆。

可以線上體驗 VoxCPM 嗎?

可以。本頁嵌入了官方 VoxCPM-Demo Hugging Face Space,因此無需先安裝 Python 套件,就可以在瀏覽器中測試 VoxCPM2。

VoxCPM2 支援哪些語言?

公開 model card 列出 30 種語言,包括中文、英文、日文、韓文、西班牙文、法文、德文、葡萄牙文、印地語、阿拉伯語、越南語等,並包含若干中文方言。

VoxCPM 支援語音克隆嗎?

支援。VoxCPM2 支援基於參考音訊的可控語音克隆,也支援結合參考音訊和轉錄文字的高保真克隆流程。請只克隆你擁有權利或獲得授權的聲音。

VoxCPM 的音色設計是什麼?

音色設計允許用自然語言描述想要的說話人,例如年齡、性別、語氣、情緒或語速,然後在沒有參考錄音的情況下產生新聲音。

嵌入的 VoxCPM Demo 是私有的嗎?

不是。嵌入應用是 Whisper AI 之外執行的公開 Hugging Face Space。請不要提交機密文字或私人聲音樣本;敏感場景應自部署模型。

在瀏覽器中體驗 VoxCPM

在官方 Hugging Face Demo 中產生多語言語音,測試音色設計,並在獲得授權的前提下評估語音克隆效果。