VoxCPM — Tokenizer-Free 多语言语音克隆 TTS
OpenBMB 的 VoxCPM2 模型,已嵌入官方 Hugging Face Space
在线体验 VoxCPM 的多语言文本转语音、自然语言音色设计、可控语音克隆和 48 kHz AI 语音输出。本页基于公开资料重新整理 VoxCPM2 信息,并嵌入官方 Demo,便于搜索和快速评估。
这是由 OpenBMB在 Hugging Face 托管的官方 VoxCPM-Demo Space。首次运行可能需要等待服务唤醒。请不要在公开 Space 中提交机密文本或私人声音样本。
VoxCPM 是什么?
VoxCPM 是 OpenBMB 推出的开源文本转语音模型族。当前的 VoxCPM2 版本面向自然的多语言语音、基于自然语言描述的音色设计,以及更接近真实说话人的语音克隆,同时避免依赖离散语音 token 的传统流程。
根据公开的 VoxCPM2 model card 和项目文档,VoxCPM2 是一个 2B 参数的 tokenizer-free diffusion autoregressive TTS 模型,训练数据规模超过 200 万小时多语言语音。它支持 30 种语言,可使用短参考音频做克隆,并通过 AudioVAE V2 输出 48 kHz 语音。
页面中的嵌入 Demo 适合快速评估:直接输入多语言文本、用自然语言描述音色、上传参考音频做可控克隆,或提供参考音频和转写文本进行更高保真的克隆测试。
VoxCPM2 为什么值得关注
VoxCPM 将多语言生成、音色设计、语音克隆和面向部署的 serving 路径放在一个开放模型工作流中。
Tokenizer-free diffusion autoregressive TTS
VoxCPM2 通过 diffusion autoregressive 架构直接生成连续语音表示,而不是依赖离散语音 token。
覆盖 30 种语言的多语言语音
公开 model card 列出 30 种支持语言,包括中文、英文、日文、韩文、西班牙文、法文、德文、葡萄牙文、印地语、阿拉伯语和越南语等。
用自然语言做音色设计
可以用性别、年龄、语气、情绪、语速等描述想要的说话人,让 VoxCPM2 在没有参考音频的情况下生成新的合成声音。
可控和高保真语音克隆
上传短参考音频以保留音色,加入风格提示来控制表达,或提供参考文本以获得更高保真的 continuation-style 克隆。
48 kHz 输出和流式推理路径
VoxCPM2 接受 16 kHz 参考音频并输出 48 kHz 语音;文档中也提到标准实时流式推理和更快的 Nano-vLLM serving。
开放且重视安全的发布
公开发布采用 Apache-2.0,但项目明确禁止冒充、欺诈和虚假信息传播。使用 AI 生成音频时应清晰标注。
四步体验 VoxCPM
托管的 Space 可以直接试用 VoxCPM2 的核心流程,无需本地安装。
打开 VoxCPM Space
使用上方嵌入的 Hugging Face Space,或在新标签页打开。冷启动时可能需要等待依赖和模型加载。
输入支持语言的文本
先粘贴一小段脚本。VoxCPM2 面向多语言输入设计,通常不需要额外语言标签。
选择音色设计或语音克隆
音色设计可以先写一段说话人描述;语音克隆则上传干净的参考音频,并在需要改变节奏或情绪时加入风格提示。
调整生成参数并试听
根据 Demo 控件调整推理步数、guidance、降噪或风格设置,先生成短样本,再迭代发音、节奏和说话人风格。
VoxCPM 能力速览
以下信息来自 VoxCPM2 Hugging Face model card、Space 元数据、文档和项目 Demo 页,并已重新整理为便于评估的说明。
可以用 VoxCPM 做什么
当语音项目同时需要多语言覆盖、表达可控和可自部署能力时,VoxCPM 会比较适合。
多语言产品旁白
在最终录制真人配音前,为产品导览、课程和解释视频快速生成多语言旁白草稿。
语音 Agent 原型
在接入生产语音 Agent 栈前,先评估不同人设、语速、情绪和 48 kHz 输出质量。
配音和本地化测试
用本地化脚本测试发音、节奏和表现力,尤其适合传统 TTS 覆盖不足的语言。
获得授权的语音克隆
只在获得许可时克隆真实声音,并用可控风格提示测试不同情绪或节奏,同时保留音色。
合成角色声音探索
当你需要全新的虚拟角色或品牌安全声音时,可用音色设计替代真实人物克隆。
开发者评估
将 VoxCPM 与其他开放 TTS 系统比较,测试 Python 包,或研究 Nano-vLLM serving 的低延迟路径。
提升 VoxCPM 效果的建议
- 先用短文本测试发音、节奏和音色一致性,再生成长文本。
- 语音克隆建议使用干净、单人说话的参考音频;噪声或多人声音会降低相似度判断。
- 如果音色设计不符合预期,用更具体的年龄、语速、情绪和声音质感来改写描述。
- 进行高保真克隆时,如果 Demo 要求提供参考转写,尽量补充对应文本以保留原始表达。
- 不要在公开 Space 中提交机密脚本或私人声音样本;敏感生产场景建议自部署 VoxCPM2。
- 不要将 VoxCPM 用于冒充、欺诈或未标注的合成媒体。克隆任何真实声音前都应获得明确授权。
VoxCPM 常见问题
面向多语言 TTS、语音克隆、音色设计和自部署评估的简短回答。
VoxCPM 是什么?
VoxCPM 是 OpenBMB 的 tokenizer-free 文本转语音模型族。VoxCPM2 是当前的 2B 参数版本,面向多语言语音生成、音色设计和语音克隆。
可以在线体验 VoxCPM 吗?
可以。本页嵌入了官方 VoxCPM-Demo Hugging Face Space,因此无需先安装 Python 包,就可以在浏览器中测试 VoxCPM2。
VoxCPM2 支持哪些语言?
公开 model card 列出 30 种语言,包括中文、英文、日文、韩文、西班牙文、法文、德文、葡萄牙文、印地语、阿拉伯语、越南语等,并包含若干中文方言。
VoxCPM 支持语音克隆吗?
支持。VoxCPM2 支持基于参考音频的可控语音克隆,也支持结合参考音频和转写文本的高保真克隆流程。请只克隆你拥有权利或获得授权的声音。
VoxCPM 的音色设计是什么?
音色设计允许用自然语言描述想要的说话人,例如年龄、性别、语气、情绪或语速,然后在没有参考录音的情况下生成新声音。
嵌入的 VoxCPM Demo 是私有的吗?
不是。嵌入应用是 Whisper AI 之外运行的公开 Hugging Face Space。请不要提交机密文本或私人声音样本;敏感场景应自部署模型。
在浏览器中体验 VoxCPM
在官方 Hugging Face Demo 中生成多语言语音,测试音色设计,并在获得授权的前提下评估语音克隆效果。
