VoxCPM2 · 30 种语言 TTS · 语音克隆

VoxCPM — Tokenizer-Free 多语言语音克隆 TTS

OpenBMB 的 VoxCPM2 模型,已嵌入官方 Hugging Face Space

在线体验 VoxCPM 的多语言文本转语音、自然语言音色设计、可控语音克隆和 48 kHz AI 语音输出。本页基于公开资料重新整理 VoxCPM2 信息,并嵌入官方 Demo,便于搜索和快速评估。

2B 参数30 种语言音色设计可控语音克隆48 kHz 输出Apache-2.0
VoxCPM2 · 官方 Hugging Face Space
在 Hugging Face 打开

这是由 OpenBMB在 Hugging Face 托管的官方 VoxCPM-Demo Space。首次运行可能需要等待服务唤醒。请不要在公开 Space 中提交机密文本或私人声音样本。

快速了解

VoxCPM 是什么?

VoxCPM 是 OpenBMB 推出的开源文本转语音模型族。当前的 VoxCPM2 版本面向自然的多语言语音、基于自然语言描述的音色设计,以及更接近真实说话人的语音克隆,同时避免依赖离散语音 token 的传统流程。

根据公开的 VoxCPM2 model card 和项目文档,VoxCPM2 是一个 2B 参数的 tokenizer-free diffusion autoregressive TTS 模型,训练数据规模超过 200 万小时多语言语音。它支持 30 种语言,可使用短参考音频做克隆,并通过 AudioVAE V2 输出 48 kHz 语音。

页面中的嵌入 Demo 适合快速评估:直接输入多语言文本、用自然语言描述音色、上传参考音频做可控克隆,或提供参考音频和转写文本进行更高保真的克隆测试。

核心特性

VoxCPM2 为什么值得关注

VoxCPM 将多语言生成、音色设计、语音克隆和面向部署的 serving 路径放在一个开放模型工作流中。

Tokenizer-free diffusion autoregressive TTS

VoxCPM2 通过 diffusion autoregressive 架构直接生成连续语音表示,而不是依赖离散语音 token。

覆盖 30 种语言的多语言语音

公开 model card 列出 30 种支持语言,包括中文、英文、日文、韩文、西班牙文、法文、德文、葡萄牙文、印地语、阿拉伯语和越南语等。

用自然语言做音色设计

可以用性别、年龄、语气、情绪、语速等描述想要的说话人,让 VoxCPM2 在没有参考音频的情况下生成新的合成声音。

可控和高保真语音克隆

上传短参考音频以保留音色,加入风格提示来控制表达,或提供参考文本以获得更高保真的 continuation-style 克隆。

48 kHz 输出和流式推理路径

VoxCPM2 接受 16 kHz 参考音频并输出 48 kHz 语音;文档中也提到标准实时流式推理和更快的 Nano-vLLM serving。

开放且重视安全的发布

公开发布采用 Apache-2.0,但项目明确禁止冒充、欺诈和虚假信息传播。使用 AI 生成音频时应清晰标注。

使用方法

四步体验 VoxCPM

托管的 Space 可以直接试用 VoxCPM2 的核心流程,无需本地安装。

1

打开 VoxCPM Space

使用上方嵌入的 Hugging Face Space,或在新标签页打开。冷启动时可能需要等待依赖和模型加载。

2

输入支持语言的文本

先粘贴一小段脚本。VoxCPM2 面向多语言输入设计,通常不需要额外语言标签。

3

选择音色设计或语音克隆

音色设计可以先写一段说话人描述;语音克隆则上传干净的参考音频,并在需要改变节奏或情绪时加入风格提示。

4

调整生成参数并试听

根据 Demo 控件调整推理步数、guidance、降噪或风格设置,先生成短样本,再迭代发音、节奏和说话人风格。

模型信息

VoxCPM 能力速览

以下信息来自 VoxCPM2 Hugging Face model card、Space 元数据、文档和项目 Demo 页,并已重新整理为便于评估的说明。

模型族
OpenBMB 的 VoxCPM / VoxCPM2
主要任务
多语言文本转语音、音色设计、可控语音克隆和高保真克隆
架构
Tokenizer-free diffusion autoregressive TTS pipeline,文档中描述为 LocEnc → TSLM → RALM → LocDiT
规模和 backbone
2B 参数,基于 MiniCPM-4 backbone
训练规模
公开 model card 中提到超过 200 万小时多语言语音数据
语言覆盖
30 种语言,并列出四川话、粤语、吴语、东北话等中文方言支持
音频质量
接受 16 kHz 参考音频,并通过 AudioVAE V2 输出 48 kHz 语音
托管 Demo
官方 Gradio Space openbmb/VoxCPM-Demo,目前服务域名为 openbmb-voxcpm-demo.hf.space
许可证
VoxCPM2 模型和 Space 元数据中标注 Apache-2.0
使用场景

可以用 VoxCPM 做什么

当语音项目同时需要多语言覆盖、表达可控和可自部署能力时,VoxCPM 会比较适合。

多语言产品旁白

在最终录制真人配音前,为产品导览、课程和解释视频快速生成多语言旁白草稿。

语音 Agent 原型

在接入生产语音 Agent 栈前,先评估不同人设、语速、情绪和 48 kHz 输出质量。

配音和本地化测试

用本地化脚本测试发音、节奏和表现力,尤其适合传统 TTS 覆盖不足的语言。

获得授权的语音克隆

只在获得许可时克隆真实声音,并用可控风格提示测试不同情绪或节奏,同时保留音色。

合成角色声音探索

当你需要全新的虚拟角色或品牌安全声音时,可用音色设计替代真实人物克隆。

开发者评估

将 VoxCPM 与其他开放 TTS 系统比较,测试 Python 包,或研究 Nano-vLLM serving 的低延迟路径。

最佳实践

提升 VoxCPM 效果的建议

  • 先用短文本测试发音、节奏和音色一致性,再生成长文本。
  • 语音克隆建议使用干净、单人说话的参考音频;噪声或多人声音会降低相似度判断。
  • 如果音色设计不符合预期,用更具体的年龄、语速、情绪和声音质感来改写描述。
  • 进行高保真克隆时,如果 Demo 要求提供参考转写,尽量补充对应文本以保留原始表达。
  • 不要在公开 Space 中提交机密脚本或私人声音样本;敏感生产场景建议自部署 VoxCPM2。
  • 不要将 VoxCPM 用于冒充、欺诈或未标注的合成媒体。克隆任何真实声音前都应获得明确授权。
FAQ

VoxCPM 常见问题

面向多语言 TTS、语音克隆、音色设计和自部署评估的简短回答。

VoxCPM 是什么?

VoxCPM 是 OpenBMB 的 tokenizer-free 文本转语音模型族。VoxCPM2 是当前的 2B 参数版本,面向多语言语音生成、音色设计和语音克隆。

可以在线体验 VoxCPM 吗?

可以。本页嵌入了官方 VoxCPM-Demo Hugging Face Space,因此无需先安装 Python 包,就可以在浏览器中测试 VoxCPM2。

VoxCPM2 支持哪些语言?

公开 model card 列出 30 种语言,包括中文、英文、日文、韩文、西班牙文、法文、德文、葡萄牙文、印地语、阿拉伯语、越南语等,并包含若干中文方言。

VoxCPM 支持语音克隆吗?

支持。VoxCPM2 支持基于参考音频的可控语音克隆,也支持结合参考音频和转写文本的高保真克隆流程。请只克隆你拥有权利或获得授权的声音。

VoxCPM 的音色设计是什么?

音色设计允许用自然语言描述想要的说话人,例如年龄、性别、语气、情绪或语速,然后在没有参考录音的情况下生成新声音。

嵌入的 VoxCPM Demo 是私有的吗?

不是。嵌入应用是 Whisper AI 之外运行的公开 Hugging Face Space。请不要提交机密文本或私人声音样本;敏感场景应自部署模型。

在浏览器中体验 VoxCPM

在官方 Hugging Face Demo 中生成多语言语音,测试音色设计,并在获得授权的前提下评估语音克隆效果。