Google: Gemini 3.8 Flash TTS logo

Google: Gemini 3.8 Flash TTS

打开

Gemini 3.8 Flash TTS 能用一句话设计全新音色、30 秒样本复刻嗓音,并以 71.4 分拿下 Hume 声音设计榜首位。

分享:
查看替代方案

Google: Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS 与更便宜的 Gemini 3.8 Flash-Lite TTS 于 2026-09-23 发布。Google 对这对模型的定位是「从预设音色转向声音设计」:你不再从现成的播音员里挑一个,而是用自然语言描述角色,再逐句导演表演。两个模型都已在 Gemini API 与 Google AI Studio 正式可用,Flash TTS 还接入了 Gemini Notebook,Flash-Lite TTS 接入了 Google Vids。

模型规格

规格 Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
输入 文本 文本
输出 音频 音频
输入 token 8K 8K
输出 token 64K 64K
状态 正式可用 正式可用
可用渠道 Gemini API、Google AI Studio、Gemini Notebook Gemini API、Google AI Studio、Google Vids
基座模型 Gemini 3 Pro Gemini 3 Pro

Google 的模型卡写明两者都基于 Gemini 3 Pro,知识截止为 2025 年 1 月,并把幻觉、偶发变慢或超时列为已知限制。

核心能力

  • 生成式声音设计:用提示词描述角色、口音、年龄、音高与质感,从零造出音色。官方博客举的例子是喷火龙和墨尔本 DJ,站点宣称覆盖 100 多种语言与方言。
  • 30 秒样本复刻:用一段 30 秒的授权样本还原嗓音。官方流程要求声音所有者提供一段与参考说话人匹配的口头同意录音。
  • 逐句导演:语气、节奏、情绪、口音切换都写在脚本里,而不是固化在模型里。Flash TTS 还支持用一份脚本调度双人对白。
  • 语气词与反馈音:支持 <laughs><sigh><gasp> 这类行内标签,以及 "mhm" 这样的附和声。
  • 长音频稳定:Google 称数小时连续音频里音色与节奏漂移很小,这是有声书与播客能落地的前提。

Flash-Lite TTS 把最深的创作控制换成吞吐量。Google 把它指向高批量配音、大型内容库和高流量语音智能体,而不是从零设计一个角色声音。

评测成绩

下表来自 Google 2026-09-23 发布的自测评估表,使用生产 checkpoint。这是厂商自测,请当作官方主张而不是第三方复现。

指标 Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS 对照
Hume AI 声音设计 Overall 71.4 未列出 ElevenLabs Voice Design v3 70.8、Inworld Voice Design 69.8
Hume AI 声音设计 Accents 60.8 未列出 ElevenLabs 45.4、Inworld 35.8
Hume AI TTS 质量 Overall 0.920 0.914 ElevenLabs v3 0.706、Cartesia Sonic 3.6 0.840
Hume AI TTS 质量 Multispeaker 4.14 4.10 Gemini 3.1 Flash TTS 3.60
Voice Arena 日语 Elo 1232 1152 Gemini 3.1 Flash TTS 1148、OpenAI gpt-4o-mini-tts 975
Voice Arena 印地语 Elo 1106 1076 Cartesia Sonic 3.6 1104、OpenAI 843

Google 自己的数据里有个清晰规律:Flash TTS 赢在声音设计与非英语语种(日语、越南语、阿拉伯语、印地语),而 Flash-Lite TTS 在英语和巴西葡语上常常拿到更高 Elo。这个信号很实用:需要便宜的英语语音就用 Flash-Lite,声音本身或非英语市场才是重点时才上 Flash TTS。

安全与水印

Gemini Audio 系列生成的每一段音频都带 SynthID 水印,复刻流程还要求显式同意校验,复刻音色同时带 C2PA 凭证。如果你的产品要面对监管或平台审核,第一个该测的就是这道同意环节,因为它落在你的注册流程里,而不是藏在某个 API 开关后面。

定价

撰写本词条时(2026-09-24),Google 尚未在语音生成页给出这两个模型的第一方价格,因此这里不引用任何金额。做预算前请到 Gemini API 定价页确认当前费率;本次写作时该网络环境无法打开模型定义页。

快速开始

  1. 产品页进入 Google AI Studio 的语音生成试验场,确认你的项目拿到的是哪个模型 id。
  2. 先用一句话提示出角色、口音与质感,再用第二行舞台指示导演表演。
  3. 如果要走复刻而不是设计,提前准备好说话人的同意音频,别等上线前才发现卡住。
  4. 明确测试目标语种。Google 自己的数据最能支撑日语、越南语、阿拉伯语和印地语。

局限

  • 输入上限 8K token:长脚本必须切块,而这正是有声书流水线里最容易产生音色漂移的地方。
  • 只有厂商自测。 本文的 Hume 与 Voice Arena 数字来自 Google 的评估表,本次网络环境无法直接打开这两个方法说明页。
  • 没有公开定价。 在核对第一方价格之前,不要搭成本模型。
  • 英语并非必然更强。 在 Google 的表里 Flash-Lite 的英语 Elo 更高,所以「更大的那个」未必是美国英语产品的更优选。

常见问题

与 Gemini 3.1 Flash TTS 有什么区别?

Gemini 3.1 Flash TTS 是上一代音频同门。Google 的 Voice Arena 表里 3.8 Flash TTS 在每一个列出的语种(含日语、印地语)都领先,3.8 这一代还加入了生成式声音设计。

可以克隆任意声音吗?

Google 公布的流程要求声音所有者提供与参考说话人匹配的口头同意录音。要基于复刻能力做产品,就得把这道关卡算进排期。

有更便宜的选项吗?

有。Gemini 3.8 Flash-Lite TTS 是高批量档,Google 把它指向配音与播客流水线。

替代方案

总结

Gemini 3.8 Flash TTS 是目前语音合成从「挑预设」变成「做设计」最清楚的例子,Google 自己的数字也把它放到了不止一个盲测榜单的首位。但注意事项同样真实:基准是厂商自测、没有公开价格、8K 输入上限会直接决定你的工程结构。如果你的产品靠特色音色或非英语市场立足,这就是本周该排进评估队列的模型。

评论

还没有评论。成为第一个评论的人!