OmniVoice — 支持 600+ 语言的声音克隆 TTS
k2-fsa 出品的多语言 zero-shot 文字转语音模型,运行于官方 Hugging Face Space
OmniVoice 可将文字转换为数百种语言的自然语音,支持基于授权、来自短参考片段的声音克隆,并允许你通过年龄、音高、口音和耳语风格等属性来设计声音。先在下方的实时演示中试用,再决定是否安装。
这是托管在 Hugging Face 上的官方 OmniVoice Space,由 k2-fsa 构建。首次运行时 ZeroGPU 启动较慢,可能需要稍等。本 Whisper AI 页面是一份独立指南,内嵌官方演示。
什么是 OmniVoice?
OmniVoice 是 k2-fsa 项目推出的大规模多语言 zero-shot 文字转语音模型。它不局限于少数固定声音,而是追求开源 TTS 模型中最广的语言覆盖,将来自数秒参考音频的声音克隆,与仅凭属性即可构建说话人的语音设计控制结合在一起。
在底层,OmniVoice 基于 Qwen3-0.6B 与扩散式语言模型架构,团队借此在不牺牲质量的前提下提升推理速度——模型卡显示实时率(RTF)低至 0.025,约为实时速度的 40 倍。此次发布涵盖 Hugging Face 模型与 Space、一篇 arXiv 论文、一个 GitHub 仓库、一个 Colab 笔记本,以及可通过 pip 安装的 omnivoice 包。
如果你在寻找 OmniVoice 演示,上方内嵌的 Space 是最快的途径:输入文字、选择语言、需要克隆时上传一段短音频、调整生成设置,即可在浏览器中直接收听 24 kHz 的 AI 语音。
OmniVoice 为何与众不同
OmniVoice 在一个开源模型工作流中融合了多语言语音生成、声音克隆和语音设计。
大规模多语言 TTS
OmniVoice 追求极广的语言覆盖;官方模型卡为文字转语音列出了 600 多个语言和方言代码。
zero-shot 声音克隆
上传一段简短的参考录音,OmniVoice 即可以相近的声音风格朗读新文本。干净的片段加上可选的文字稿能带来最佳匹配。
无需参考的语音设计
没有录音?可基于性别、年龄、音高、耳语风格、英语口音或中文方言等属性构建合成声音。
快速的扩散式生成
OmniVoice 采用扩散式语言模型架构;模型卡显示实时率(RTF)低至 0.025,约为实时速度的 40 倍。
基于 Qwen3 的开源模型
该模型基于 Qwen3-0.6B,并以 Hugging Face 模型与 Space、可通过 pip 安装的包,以及公开的 GitHub 仓库形式发布。
负责任的语音保护
官方说明禁止未经授权的克隆、冒充和非法用途。仅在获得说话人许可时才克隆其声音。
四步试用 OmniVoice
托管的 Space 让你无需本地配置即可使用 OmniVoice 的主要控制项。
选择模式
打开内嵌的 OmniVoice 演示:有参考录音就选 Voice Clone,想从属性构建说话人就选 Voice Design。
输入文字与语言
粘贴要合成的文本。可将语言保持为自动检测,或在多语言下拉菜单中选择特定语言。
添加声音上下文或设计设置
克隆时,上传一段简短干净的样本,并可选附上其文字稿。设计时,设置年龄、音高、口音或耳语风格等属性。
调整生成并收听
调整速度、时长、推理步数、guidance 和 denoise 等设置,然后生成并播放 24 kHz 音频输出。
OmniVoice 能力一览
来自公开 Hugging Face Space、模型卡和演示界面的关键信息,已在此重写以便快速评估。
你可以用 OmniVoice 做什么
当语音项目既需要多语言广度,又需要灵活的说话人控制时,OmniVoice 尤其有用。
本地化与配音
为产品视频、课程、旁白和多语言创意工作快速生成多语言的草稿配音。
语音智能体原型
在搭建生产级对话式 AI 或电话客服之前,先测试声音个性、口音和节奏。
无障碍音频内容
将文章、文档和学习资料转为语音,服务更愿意收听或需要音频替代方案的人群。
角色与风格探索
用语音设计探索年龄、音高、耳语以及口音或方言选项,而无需为每个变体录制参考声音。
研究与评测
将 zero-shot 克隆、多语言发音和可控说话人属性与你自己的 TTS 基线进行对比。
开发者实验
安装 omnivoice 包或使用 GitHub 代码,测试 Python 推理、批量生成和自定义流水线。
获得更好 OmniVoice 效果的技巧
- 使用单一说话人、背景噪声低、音量自然的干净参考录音。
- 首次测试保持简短,以便快速检查发音、节奏和声音相似度。
- 当自动检测在短文本或混合语种文本上表现不佳时,手动选择语言。
- 在没有授权的情况下,优先使用语音设计生成合成人物,而不是克隆真实人物。
- 添加 [laughter] 等非语言提示,或用拼音、音素纠正难读词,以打磨成品。
- 不要把机密文本粘贴到公开演示中;安装 omnivoice 包,自行运行敏感任务。
OmniVoice 常见问题
为评估 OmniVoice 用于 AI 声音克隆、多语言 TTS 和语音设计的用户提供简短解答。
什么是 OmniVoice?
OmniVoice 是 k2-fsa 项目推出的大规模多语言 zero-shot 文字转语音模型。它可以合成 600 多种语言的语音,从一段短参考片段克隆声音,并根据说话人属性设计声音。
我可以免费在线试用 OmniVoice 吗?
可以。上方面板内嵌了 Hugging Face 上的官方 OmniVoice Space,你无需先安装 Python 包即可在浏览器中试用实时演示。
OmniVoice 支持声音克隆吗?
支持。在 Voice Clone 模式下,OmniVoice 使用一段短参考音频和可选的文字稿来引导生成的声音。请仅克隆你拥有或获得明确许可的声音。
OmniVoice 的语音设计是什么?
语音设计让你设定性别、年龄、音高、耳语风格、英语口音或中文方言等说话人属性,然后无需任何参考录音即可生成声音。
OmniVoice 支持多少种语言?
官方模型卡列出了 600 多个语言和方言代码,是开源 zero-shot TTS 模型中覆盖最广的之一。在投入生产前,请先在实时 Space 中测试你的目标语言。
OmniVoice 是开源的吗?
OmniVoice 基于 Qwen3-0.6B,以 Apache-2.0 许可证发布,配有 Hugging Face 模型与 Space、GitHub 仓库以及可通过 pip 安装的 omnivoice 包。商用前请查阅许可证。
托管的 OmniVoice 演示是私密的吗?
内嵌演示由 Hugging Face 托管,而非 Whisper AI。请勿在公开 Space 中输入敏感文本或音频;如需处理机密内容,请安装 omnivoice 包并自行运行模型。
在浏览器中试用 OmniVoice
在官方 Hugging Face 演示中生成多语言语音、在获得授权的前提下测试声音克隆,并探索语音设计控制。
