VoxCPM — Tokenizer-Free 多語言語音克隆 TTS
OpenBMB 的 VoxCPM2 模型,已嵌入官方 Hugging Face Space
線上體驗 VoxCPM 的多語言文字轉語音、自然語言音色設計、可控語音克隆和 48 kHz AI 語音輸出。本頁基於公開資料重新整理 VoxCPM2 資訊,並嵌入官方 Demo,便於搜尋和快速評估。
這是由 OpenBMB在 Hugging Face 託管的官方 VoxCPM-Demo Space。首次執行可能需要等待服務喚醒。請不要在公開 Space 中提交機密文字或私人聲音樣本。
VoxCPM 是什麼?
VoxCPM 是 OpenBMB 推出的開源文字轉語音模型族。目前的 VoxCPM2 版本面向自然的多語言語音、基於自然語言描述的音色設計,以及更接近真實說話人的語音克隆,同時避免依賴離散語音 token 的傳統流程。
根據公開的 VoxCPM2 model card 和專案技術文件,VoxCPM2 是一個 2B 參數的 tokenizer-free diffusion autoregressive TTS 模型,訓練資料規模超過 200 萬小時多語言語音。它支援 30 種語言,可使用短參考音訊做克隆,並透過 AudioVAE V2 輸出 48 kHz 語音。
頁面中的嵌入 Demo 適合快速評估:直接輸入多語言文字、用自然語言描述音色、上傳參考音訊做可控克隆,或提供參考音訊和轉錄文字進行更高保真的克隆測試。
VoxCPM2 為什麼值得關注
VoxCPM 將多語言產生、音色設計、語音克隆和麵向部署的 serving 路徑放在一個開放模型工作流程中。
Tokenizer-free diffusion autoregressive TTS
VoxCPM2 透過 diffusion autoregressive 架構直接產生連續語音表示,而不是依賴離散語音 token。
覆蓋 30 種語言的多語言語音
公開 model card 列出 30 種支援語言,包括中文、英文、日文、韓文、西班牙文、法文、德文、葡萄牙文、印地語、阿拉伯語和越南語等。
用自然語言做音色設計
可以用性別、年齡、語氣、情緒、語速等描述想要的說話人,讓 VoxCPM2 在沒有參考音訊的情況下產生新的合成聲音。
可控和高保真語音克隆
上傳短參考音訊以保留音色,加入風格提示來控制表達,或提供參考文字以獲得更高保真的 continuation-style 克隆。
48 kHz 輸出和串流推理路徑
VoxCPM2 接受 16 kHz 參考音訊並輸出 48 kHz 語音;技術文件中也提到標準即時串流推理和更快的 Nano-vLLM serving。
開放且重視安全的釋出
公開發布採用 Apache-2.0,但專案明確禁止冒充、欺詐和虛假資訊傳播。使用 AI 產生音訊時應清晰標註。
四步體驗 VoxCPM
託管的 Space 可以直接試用 VoxCPM2 的核心流程,無需本地安裝。
開啟 VoxCPM Space
使用上方嵌入的 Hugging Face Space,或在新標籤頁開啟。冷啟動時可能需要等待依賴和模型載入。
輸入支援語言的文字
先貼上一小段指令碼。VoxCPM2 面向多語言輸入設計,通常不需要額外語言標籤。
選擇音色設計或語音克隆
音色設計可以先寫一段說話人描述;語音克隆則上傳乾淨的參考音訊,並在需要改變節奏或情緒時加入風格提示。
調整產生參數並試聽
根據 Demo 控制元件調整推理步數、guidance、降噪或風格設定,先產生短樣本,再迭代發音、節奏和說話人風格。
VoxCPM 能力速覽
以下資訊來自 VoxCPM2 Hugging Face model card、Space 後設資料、技術文件和專案 Demo 頁,並已重新整理為便於評估的說明。
可以用 VoxCPM 做什麼
當語音專案同時需要多語言覆蓋、表達可控和可自部署能力時,VoxCPM 會比較適合。
多語言產品旁白
在最終錄製真人配音前,為產品導覽、課程和解釋影片快速產生多語言旁白草稿。
語音 Agent 原型
在接入生產語音 Agent 棧前,先評估不同人設、語速、情緒和 48 kHz 輸出品質。
配音和本地化測試
用本地化指令碼測試發音、節奏和表現力,尤其適合傳統 TTS 覆蓋不足的語言。
獲得授權的語音克隆
只在獲得許可時克隆真實聲音,並用可控風格提示測試不同情緒或節奏,同時保留音色。
合成角色聲音探索
當你需要全新的虛擬角色或品牌安全聲音時,可用音色設計替代真實人物克隆。
開發者評估
將 VoxCPM 與其他開放 TTS 系統比較,測試 Python 套件,或研究 Nano-vLLM serving 的低延遲路徑。
提升 VoxCPM 效果的建議
- 先用短文字測試發音、節奏和音色一致性,再產生長文字。
- 語音克隆建議使用乾淨、單人說話的參考音訊;噪聲或多人聲音會降低相似度判斷。
- 如果音色設計不符合預期,用更具體的年齡、語速、情緒和聲音質感來改寫描述。
- 進行高保真克隆時,如果 Demo 要求提供參考轉錄,儘量補充對應文字以保留原始表達。
- 不要在公開 Space 中提交機密指令碼或私人聲音樣本;敏感生產場景建議自部署 VoxCPM2。
- 不要將 VoxCPM 用於冒充、欺詐或未標註的合成媒體。克隆任何真實聲音前都應獲得明確授權。
VoxCPM 常見問題
面向多語言 TTS、語音克隆、音色設計和自部署評估的簡短回答。
VoxCPM 是什麼?
VoxCPM 是 OpenBMB 的 tokenizer-free 文字轉語音模型族。VoxCPM2 是目前的 2B 參數版本,面向多語言語音產生、音色設計和語音克隆。
可以線上體驗 VoxCPM 嗎?
可以。本頁嵌入了官方 VoxCPM-Demo Hugging Face Space,因此無需先安裝 Python 套件,就可以在瀏覽器中測試 VoxCPM2。
VoxCPM2 支援哪些語言?
公開 model card 列出 30 種語言,包括中文、英文、日文、韓文、西班牙文、法文、德文、葡萄牙文、印地語、阿拉伯語、越南語等,並包含若干中文方言。
VoxCPM 支援語音克隆嗎?
支援。VoxCPM2 支援基於參考音訊的可控語音克隆,也支援結合參考音訊和轉錄文字的高保真克隆流程。請只克隆你擁有權利或獲得授權的聲音。
VoxCPM 的音色設計是什麼?
音色設計允許用自然語言描述想要的說話人,例如年齡、性別、語氣、情緒或語速,然後在沒有參考錄音的情況下產生新聲音。
嵌入的 VoxCPM Demo 是私有的嗎?
不是。嵌入應用是 Whisper AI 之外執行的公開 Hugging Face Space。請不要提交機密文字或私人聲音樣本;敏感場景應自部署模型。
在瀏覽器中體驗 VoxCPM
在官方 Hugging Face Demo 中產生多語言語音,測試音色設計,並在獲得授權的前提下評估語音克隆效果。
