Miso One — 富有情感的 AI 文字转语音
Miso Labs 的 MisoTTS 模型,在你的浏览器中实时运行
Miso One 是一个开放权重、约 80 亿参数的文字转语音模型,旨在让声音听起来真正像人——温暖、富有表现力且充满情感。在下方输入任意英文文本即可聆听逼真的 AI 语音,或从一段简短片段克隆声音。
该演示是托管在 Hugging Face 上的官方 MisoTTS Space。首次生成可能会在 GPU 预热时稍慢一些。Miso One 与 MisoTTS 是以下公司的产品: Miso Labs;本页是一份独立指南,内嵌了官方演示。
什么是 Miso One?
Miso One 是 Miso Labs 推出的情感丰富的 AI 文字转语音模型,Miso Labs 是一家受 Y Combinator 支持的语音 AI 初创公司。该模型于 2026 年 6 月初以技术名称 MisoTTS 发布,是一个约 80 亿参数的语音合成模型,旨在让 AI 声音听起来真正像人——在大多数文字转语音仍显平淡之处,带来真实的温暖、节奏与情感。
在底层,Miso One 将 Llama 3.2 风格的主干与一个更小的自回归音频解码器配对——这是一个受 Sesame 的 CSM 架构启发的 RVQ Transformer——并根据你的文本和可选的音频上下文生成 Mimi 音频编码。它支持从约 10 秒的片段进行一次性声音克隆,Miso Labs 以开放权重发布了它,方便开发者自行运行。
本页顶部的交互面板就是官方的 MisoTTS Hugging Face Space,因此你现在就能将 Miso One 当作 AI 语音生成器来试用——无需安装。
Miso One 为何出众
富有情感的表达、声音克隆和开放权重,使 Miso One 成为一个强大且对开发者友好的文字转语音模型。
真正富有情感的语音
Miso One 旨在像真人一样朗读——带着温暖、节奏与情感——而不是大多数文字转语音仍在产生的平淡、机械的表达。
一次性声音克隆
从约 10 秒的参考片段克隆一种声音,然后让 Miso One 用该声音朗读新的句子。请仅在获得说话者同意的情况下使用克隆。
低延迟生成
Miso Labs 称首个 token 的延迟约为 110 毫秒,可实现响应迅速的对话式播放。请将该数字视为厂商基准。
约 8B 参数架构
Llama 3.2 风格的主干搭配一个更小的音频解码器——一个受 Sesame CSM 启发的 RVQ Transformer——从文本生成 Mimi 音频编码。
开放权重,可自托管
以修改版 MIT 许可证、开放权重发布,因此你可以在本地运行 Miso One,将音频和文本保留在自己的机器上。
为开发者打造
从 Hugging Face 拉取 MisoLabs/MisoTTS 权重并集成到你自己的技术栈中。Miso Labs 称托管 API 即将推出。
富有表现力的英语声音
Miso One 目前专注于自然的英语语音,带有逼真的语调、重音和遵循你标点的措辞。
感知语气的输出
该模型同时基于你的文本和可选的音频上下文进行条件化,因此表达可以契合你想要的情绪与能量。
四步用 Miso One 生成语音
一切都在上方内嵌的演示中完成——无需账户或任何设置即可开始。
输入或粘贴你的文本
在上方的 Miso One 演示中输入你想朗读的英文文本。标点和自然的措辞会引导情感与节奏。
添加参考声音(可选)
如果你希望 Miso One 为输出克隆特定的声音,请提供一段简短、干净的参考片段——约 10 秒。
调整并生成
使用演示提供的任何表现力或长度控件,然后生成。首次运行在 Hugging Face Space 预热时可能较慢。
播放、下载或自托管
聆听并下载生成的音频。对于生产用途,请自行运行开放的 MisoTTS 权重,让你的数据永不离开你的基础设施。
你可以用 Miso One 构建什么
富有情感的 AI 语音适用于各类语音与音频产品。
配音与旁白
为讲解视频、广告和社交视频制作富有表现力的旁白,无需预订录音棚。
对话式语音代理
凭借低延迟、富有情感的表达,为助手、IVR 和支持机器人赋予听起来像人的声音。
有声书与在线教育
将长篇脚本和课程转换为听感自然的语音,节奏与语气保持一致。
游戏与角色对白
使用一次性声音克隆,以独特、富有情感的声音为角色台词制作原型或正式上线。
无障碍
用更易于、更悦耳聆听的声音朗读文章、文档和界面。
播客与内容创作
起草开场白、广告口播和片段,或为可重复的内容生成一致的声音。
获得更好结果的提示
- 按你希望被朗读的方式书写——逗号、句号和换行会塑造 Miso One 的节奏与重音。
- 进行声音克隆时,使用干净、约 10 秒的单声道片段,尽量减少背景噪音以获得最佳匹配。
- 将长脚本拆分为自然的句子;逐段生成,而不是一个巨大的整块。
- 首次生成在 ZeroGPU Space 启动时可能较慢——之后的运行会更快。
- 请勿将敏感或私密文本粘贴到公开演示中。对于机密工作,请自托管开放权重。
Miso One 常见问题
关于 Miso One、MisoTTS 和 Miso Labs 的常见问题。
什么是 Miso One?
Miso One 是 Miso Labs 推出的开放权重、情感丰富的 AI 文字转语音(TTS)模型。它能从文本生成逼真、富有表现力的英语语音,并可从一段简短的参考片段克隆声音。上方的交互面板就是运行在 Hugging Face 上的官方 MisoTTS 演示。
Miso One 和 MisoTTS 是一回事吗?
是的。“Miso One”是产品名称,“MisoTTS”是同一模型的开源发布与代码仓库名称。你会在 GitHub 项目以及 Hugging Face 的模型和 Space 上看到 MisoTTS 这个名称。
谁创造了 Miso One?
Miso One 由 Miso Labs 打造,这是一家受 Y Combinator 支持、专注于情感语音 AI 的初创公司。它于 2026 年 6 月初以开放权重发布。
Miso One 是免费且开源的吗?
上方的演示可在浏览器中免费试用,Miso Labs 以修改版 MIT 许可证、开放权重发布了该模型。在商业使用前,请在官方仓库中查阅确切的许可条款。
Miso One 支持哪些语言?
Miso One 目前专注于英语。其他语言在发布时未被记录为受支持。
Miso One 能克隆声音吗?
可以。Miso Labs 描述了从约 10 秒参考片段进行的一次性声音克隆。请仅克隆你有权使用的声音,并遵守适用的法律和平台规则。
模型有多大、速度有多快?
Miso One 被描述为约 80 亿参数的模型(Llama 3.2 风格的主干加一个音频解码器)。Miso Labs 称首个 token 的延迟约为 110 毫秒;该数字是厂商声明,而非独立基准。
我的数据是否保持私密?
由于权重是开放的,你可以自托管 Miso One,将音频和文本完全保留在自己的机器上。上方托管的演示运行在 Hugging Face 上,因此请勿将机密内容粘贴其中。
亲耳听听 Miso One
输入一句话、选择一种声音,几秒内即可聆听富有情感的 AI 语音——然后探索开放权重,用 MisoTTS 进行构建。
