600+ 语言 TTS · 声音克隆 · 实时演示

OmniVoice — 支持 600+ 语言的声音克隆 TTS

k2-fsa 出品的多语言 zero-shot 文字转语音模型,运行于官方 Hugging Face Space

OmniVoice 可将文字转换为数百种语言的自然语音,支持基于授权、来自短参考片段的声音克隆,并允许你通过年龄、音高、口音和耳语风格等属性来设计声音。先在下方的实时演示中试用,再决定是否安装。

600+ 语言zero-shot 声音克隆语音设计控制Apache-2.0 许可证Hugging Face Space
OmniVoice · 官方 Hugging Face Space
在 Hugging Face 中打开

这是托管在 Hugging Face 上的官方 OmniVoice Space,由 k2-fsa 构建。首次运行时 ZeroGPU 启动较慢,可能需要稍等。本 Whisper AI 页面是一份独立指南,内嵌官方演示。

概览

什么是 OmniVoice?

OmniVoice 是 k2-fsa 项目推出的大规模多语言 zero-shot 文字转语音模型。它不局限于少数固定声音,而是追求开源 TTS 模型中最广的语言覆盖,将来自数秒参考音频的声音克隆,与仅凭属性即可构建说话人的语音设计控制结合在一起。

在底层,OmniVoice 基于 Qwen3-0.6B 与扩散式语言模型架构,团队借此在不牺牲质量的前提下提升推理速度——模型卡显示实时率(RTF)低至 0.025,约为实时速度的 40 倍。此次发布涵盖 Hugging Face 模型与 Space、一篇 arXiv 论文、一个 GitHub 仓库、一个 Colab 笔记本,以及可通过 pip 安装的 omnivoice 包。

如果你在寻找 OmniVoice 演示,上方内嵌的 Space 是最快的途径:输入文字、选择语言、需要克隆时上传一段短音频、调整生成设置,即可在浏览器中直接收听 24 kHz 的 AI 语音。

功能

OmniVoice 为何与众不同

OmniVoice 在一个开源模型工作流中融合了多语言语音生成、声音克隆和语音设计。

大规模多语言 TTS

OmniVoice 追求极广的语言覆盖;官方模型卡为文字转语音列出了 600 多个语言和方言代码。

zero-shot 声音克隆

上传一段简短的参考录音,OmniVoice 即可以相近的声音风格朗读新文本。干净的片段加上可选的文字稿能带来最佳匹配。

无需参考的语音设计

没有录音?可基于性别、年龄、音高、耳语风格、英语口音或中文方言等属性构建合成声音。

快速的扩散式生成

OmniVoice 采用扩散式语言模型架构;模型卡显示实时率(RTF)低至 0.025,约为实时速度的 40 倍。

基于 Qwen3 的开源模型

该模型基于 Qwen3-0.6B,并以 Hugging Face 模型与 Space、可通过 pip 安装的包,以及公开的 GitHub 仓库形式发布。

负责任的语音保护

官方说明禁止未经授权的克隆、冒充和非法用途。仅在获得说话人许可时才克隆其声音。

使用方法

四步试用 OmniVoice

托管的 Space 让你无需本地配置即可使用 OmniVoice 的主要控制项。

1

选择模式

打开内嵌的 OmniVoice 演示:有参考录音就选 Voice Clone,想从属性构建说话人就选 Voice Design。

2

输入文字与语言

粘贴要合成的文本。可将语言保持为自动检测,或在多语言下拉菜单中选择特定语言。

3

添加声音上下文或设计设置

克隆时,上传一段简短干净的样本,并可选附上其文字稿。设计时,设置年龄、音高、口音或耳语风格等属性。

4

调整生成并收听

调整速度、时长、推理步数、guidance 和 denoise 等设置,然后生成并播放 24 kHz 音频输出。

模型详情

OmniVoice 能力一览

来自公开 Hugging Face Space、模型卡和演示界面的关键信息,已在此重写以便快速评估。

核心任务
文字转语音、zero-shot 声音克隆与语音设计
语言覆盖
模型卡列出 600+ 语言和方言代码
基础模型
Qwen3-0.6B,采用扩散式语言模型架构
推理速度
模型卡显示实时率(RTF)低至 0.025,约为实时速度的 40 倍
音频与输入
24 kHz 输出;可选的短参考片段用于驱动声音克隆
精细控制
支持 [laughter] 等非语言提示,以及通过拼音或音素进行发音纠正
许可证
据 Hugging Face 模型与 Space 元数据为 Apache-2.0
应用场景

你可以用 OmniVoice 做什么

当语音项目既需要多语言广度,又需要灵活的说话人控制时,OmniVoice 尤其有用。

本地化与配音

为产品视频、课程、旁白和多语言创意工作快速生成多语言的草稿配音。

语音智能体原型

在搭建生产级对话式 AI 或电话客服之前,先测试声音个性、口音和节奏。

无障碍音频内容

将文章、文档和学习资料转为语音,服务更愿意收听或需要音频替代方案的人群。

角色与风格探索

用语音设计探索年龄、音高、耳语以及口音或方言选项,而无需为每个变体录制参考声音。

研究与评测

将 zero-shot 克隆、多语言发音和可控说话人属性与你自己的 TTS 基线进行对比。

开发者实验

安装 omnivoice 包或使用 GitHub 代码,测试 Python 推理、批量生成和自定义流水线。

最佳实践

获得更好 OmniVoice 效果的技巧

  • 使用单一说话人、背景噪声低、音量自然的干净参考录音。
  • 首次测试保持简短,以便快速检查发音、节奏和声音相似度。
  • 当自动检测在短文本或混合语种文本上表现不佳时,手动选择语言。
  • 在没有授权的情况下,优先使用语音设计生成合成人物,而不是克隆真实人物。
  • 添加 [laughter] 等非语言提示,或用拼音、音素纠正难读词,以打磨成品。
  • 不要把机密文本粘贴到公开演示中;安装 omnivoice 包,自行运行敏感任务。
常见问题

OmniVoice 常见问题

为评估 OmniVoice 用于 AI 声音克隆、多语言 TTS 和语音设计的用户提供简短解答。

什么是 OmniVoice?

OmniVoice 是 k2-fsa 项目推出的大规模多语言 zero-shot 文字转语音模型。它可以合成 600 多种语言的语音,从一段短参考片段克隆声音,并根据说话人属性设计声音。

我可以免费在线试用 OmniVoice 吗?

可以。上方面板内嵌了 Hugging Face 上的官方 OmniVoice Space,你无需先安装 Python 包即可在浏览器中试用实时演示。

OmniVoice 支持声音克隆吗?

支持。在 Voice Clone 模式下,OmniVoice 使用一段短参考音频和可选的文字稿来引导生成的声音。请仅克隆你拥有或获得明确许可的声音。

OmniVoice 的语音设计是什么?

语音设计让你设定性别、年龄、音高、耳语风格、英语口音或中文方言等说话人属性,然后无需任何参考录音即可生成声音。

OmniVoice 支持多少种语言?

官方模型卡列出了 600 多个语言和方言代码,是开源 zero-shot TTS 模型中覆盖最广的之一。在投入生产前,请先在实时 Space 中测试你的目标语言。

OmniVoice 是开源的吗?

OmniVoice 基于 Qwen3-0.6B,以 Apache-2.0 许可证发布,配有 Hugging Face 模型与 Space、GitHub 仓库以及可通过 pip 安装的 omnivoice 包。商用前请查阅许可证。

托管的 OmniVoice 演示是私密的吗?

内嵌演示由 Hugging Face 托管,而非 Whisper AI。请勿在公开 Space 中输入敏感文本或音频;如需处理机密内容,请安装 omnivoice 包并自行运行模型。

在浏览器中试用 OmniVoice

在官方 Hugging Face 演示中生成多语言语音、在获得授权的前提下测试声音克隆,并探索语音设计控制。