Breeze TTS 2 logo

Breeze TTS 2

打开

BreezeBlue 开源的双语语音合成模型,专为实时交互而生。支持免参考音色的语音设计、参考引导的音色指挥,冷启动首音频低于 40ms。

分享:

Breeze TTS 2

Breeze TTS 2 是 BreezeBlue 推出的开源权重语音合成模型,2026-08-25 发布了权重与 PyTorch 推理代码。它面向实时交互设计,发布时在 Artificial Analysis TTS 榜单上位列开源权重模型第一,并跑赢部分前沿闭源系统。单一模型即可自然地说中英文,也能用一句话设计音色或对克隆音色进行指挥调整。

核心功能

  • 免参考音色的语音设计:用自然语言描述一段音色,无需任何参考音频即可凭空生成。
  • 参考引导的音色指挥:从参考音频克隆音色后,再通过一句话调节语气、情绪、语速与表达方式。
  • 带转录的语音克隆:传入参考音频及其精确转录,即可保留音色、节奏、情感与风格。
  • 行内情感事件:直接在文本中加入事件,如英文的 (laugh)(cough)(clears throat)(sigh),或中文的 [笑][咳嗽][清嗓子][叹气]
  • 超低延迟:在 NVIDIA H100 上使用预热后的 fast path,首音频低于 40ms,RTF 为 0.32(约为实时的 3.1 倍)。
  • GPU 友好:跳过预热约需 7.7 GiB 显存;12GB 显卡是最低推荐配置。

适用场景

谁应该使用这个工具?

  • 实时语音产品:需要快速响应的助手或对话类应用。
  • 游戏与影视配音团队:希望不请配音棚也能获得可控音色的小团队。
  • 本地化团队:需要一套模型兼顾中英文输出。

解决的问题

  1. 延迟扼杀对话感:低于 40ms 的首音频让轮流对话更自然。
  2. 克隆过于脆弱:参考引导能在克隆后微调音色,无需重新录制。
  3. 没有样本也能设计:语音设计只靠文字描述就能得到初始音色。

定价方案

途径 费用 说明
权重 + 推理代码 $0 权重与代码发布在 GitHub 与 Hugging Face。
授权 非商用 推理代码为 Apache 2.0;模型权重、衍生模型与自托管输出仅供研究与非商业用途。
算力 自理 在你自己的 CUDA GPU 上运行;跳过预热约 7.7 GiB。

优势对比

  • 开源权重 TTS 榜单第一:发布时在 Artificial Analysis 上领先部分闭源系统。
  • 双控制模式:免参考的语音设计 + 参考引导的音色指挥,外加经典语音克隆。
  • 真正的双语:一套模型处理中英文,而非拆成两个权重。

快速开始

  1. 克隆 breezeblue-ai/breeze-tts
  2. BreezeBlue/Breeze-TTS-2 安装权重。
  3. 使用至少 12GB 的 CUDA GPU(fast path 建议 24GB)。
  4. 用一个文本提示开始,并在你的语言中加入行内情感事件。

常见问题

可以商用吗?

推理代码为 Apache 2.0,但权重、衍生模型与自托管输出仅供研究与非商业用途。发布产品前请先核对授权。

生成音色必须提供参考音频吗?

不一定。语音设计只需自然语言描述;语音指挥与克隆才需要带转录的参考音频。

支持哪些语言?

单一模型支持英文与中文。

替代方案

使用技巧

  1. 当作慢时看重延迟,选 fast path,但要预留 24GB 显存。
  2. 克隆时提供参考音频的转录,能得到更干净的克隆。
  3. 行内情感事件要克制,过多听起来会显得过度制作。

总结

Breeze TTS 2 是一个开源权重、低延迟、双语的语音合成模型,把前沿的音质与可控性放到你自己的 GPU 上。从 GitHub 仓库开始,先核对授权是否符合你的场景,再投入做一个实时语音体验。

Limitation: 本页不能替代官方文档,下单前再核 https://breezeblue.ai/breeze-tts-2

评论

还没有评论。成为第一个评论的人!