Google: Gemini 3.8 Flash TTS logo

Google: Gemini 3.8 Flash TTS

開く

Gemini 3.8 Flash TTS は一文で新しい声を設計し、30 秒の音声から声を複製できる。Hume の音声設計ベンチマークで 71.4 を記録。

共有:
代替ツールを見る

Google: Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS と、より安価な Gemini 3.8 Flash-Lite TTS は 2026-09-23 に発表されました。Google の位置づけは「プリセット音声から音声設計へ」の転換です。既成のナレーターを選ぶのではなく、自然言語でキャラクターを記述し、台本を一行ずつ演出します。両モデルは Gemini API と Google AI Studio で一般提供され、Flash TTS は Gemini Notebook にも、Flash-Lite TTS は Google Vids にも展開されています。

モデル仕様

仕様 Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
入力 テキスト テキスト
出力 音声 音声
入力トークン 8K 8K
出力トークン 64K 64K
ステータス 一般提供 一般提供
提供チャネル Gemini API、Google AI Studio、Gemini Notebook Gemini API、Google AI Studio、Google Vids
ベースモデル Gemini 3 Pro Gemini 3 Pro

Google のモデルカードによれば両モデルは Gemini 3 Pro をベースにし、知識カットオフは 2025 年 1 月です。ハルシネーションや、まれな遅延・タイムアウトも既知の制限として挙げられています。

主な機能

  • 生成的な声の設計:役割、アクセント、年齢、ピッチ、質感をプロンプトで指定し、ゼロから声を作れます。公式ブログの例は火を吹くドラゴンとメルボルンの DJ で、サイトは 100 以上の言語と方言への対応をうたっています。
  • 30 秒サンプルからの複製:同意済みの 30 秒サンプルから声を再現します。公式フローでは、参照話者と一致する音声による同意録音が求められます。
  • 行単位の演出:感情、テンポ、アクセントの切り替えを台本側に書きます。Flash TTS は 1 本の台本で 2 話者の対話も組めます。
  • 声のバーストと相づち<laughs><sigh><gasp> などのインラインタグと、"mhm" のような相づちに対応します。
  • 長時間の安定性:数時間の連続音声でも声質とテンポのドリフトが小さいと Google は説明しています。オーディオブックやポッドキャストの前提条件です。

Flash-Lite TTS は最も深い創作制御をスループットと引き換えにします。Google は大量の吹き替え、大規模なコンテンツライブラリ、高トラフィックの音声エージェント向けと位置づけており、キャラクターの声をゼロから設計する用途ではありません。

ベンチマーク

以下は Google が 2026-09-23 に公開した自社評価シートの数値で、本番チェックポイントを使った測定です。ベンダー自身による評価なので、第三者の再現結果ではなく公式の主張として扱ってください。

指標 Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS 比較
Hume AI 音声設計 Overall 71.4 記載なし ElevenLabs Voice Design v3 70.8、Inworld Voice Design 69.8
Hume AI 音声設計 Accents 60.8 記載なし ElevenLabs 45.4、Inworld 35.8
Hume AI TTS 品質 Overall 0.920 0.914 ElevenLabs v3 0.706、Cartesia Sonic 3.6 0.840
Hume AI TTS 品質 Multispeaker 4.14 4.10 Gemini 3.1 Flash TTS 3.60
Voice Arena 日本語 Elo 1232 1152 Gemini 3.1 Flash TTS 1148、OpenAI gpt-4o-mini-tts 975
Voice Arena ヒンディー語 Elo 1106 1076 Cartesia Sonic 3.6 1104、OpenAI 843

Google 自身のデータには明確な傾向があります。Flash TTS は声の設計と非英語圏(日本語、ベトナム語、アラビア語、ヒンディー語)で勝ち、Flash-Lite TTS は英語とブラジルポルトガル語でより高い Elo を出すことが多いのです。実務的には、安価な英語音声が欲しいなら Flash-Lite、声そのものや非英語市場が本題なら Flash TTS を選ぶことになります。

安全性とウォーターマーク

Gemini Audio シリーズが生成するすべての音声には SynthID のウォーターマークが入り、複製フローでは明示的な同意確認が求められ、複製音声には C2PA クレデンシャルも付きます。規制やプラットフォーム審査に向き合う製品なら、最初に検証すべきはこの同意ステップです。API の裏側ではなく、オンボーディング動線の中にあるからです。

料金

本記事の執筆時点(2026-09-24)で、Google は音声生成ページに両モデルのファーストパーティ価格を掲載していません。したがってここでは金額を引用しません。予算を組む前に Gemini API の料金ページで最新のレートを確認してください。なお執筆時のこのネットワーク環境からは、モデル定義ページを開けませんでした。

はじめかた

  1. 製品ページから Google AI Studio の音声生成プレイグラウンドに入り、自分のプロジェクトがどのモデル id を割り当てられるか確認します。
  2. まず一文で役割、アクセント、質感をプロンプトし、次の行で演出指示を書きます。
  3. 設計ではなく複製を使うなら、話者本人の同意音声を先に用意します。公開直前に気づくと詰みます。
  4. 対象言語を明示的にテストします。Google 自身の数値が最も支えているのは日本語、ベトナム語、アラビア語、ヒンディー語です。

制限

  • 入力上限 8K トークン:長い台本は分割が必要で、ここがオーディオブックパイプラインで声質ドリフトが起きる典型的な箇所です。
  • ベンダー評価のみ。 本記事の Hume と Voice Arena の数値は Google の評価シート由来で、執筆時のこの環境からは両手法の説明ページを直接開けませんでした。
  • 公開価格がない。 ファーストパーティの料金を確認するまでコストモデルを組まないでください。
  • 英語で必ずしも強いわけではない。 Google の表では Flash-Lite の英語 Elo が上です。「大きい方」が米国英語製品の最適解とは限りません。

よくある質問

Gemini 3.1 Flash TTS との違いは?

Gemini 3.1 Flash TTS は前世代の音声モデルです。Google の Voice Arena 表では 3.8 Flash TTS が記載されたすべての言語(日本語、ヒンディー語を含む)で上回り、3.8 世代では生成的な声の設計も加わりました。

任意の声をクローンできますか?

Google が公開しているフローでは、参照話者と一致する音声による同意録音が必要です。複製機能を製品に組み込むなら、この関門をスケジュールに織り込んでください。

もっと安い選択肢はありますか?

あります。Gemini 3.8 Flash-Lite TTS が大量処理向けのティアで、Google は吹き替えやポッドキャストのパイプライン向けとしています。

代替案

  • Gemini 3.1 Flash TTS:前世代の音声モデル。現在も提供中。
  • sanoTTS:セルフホストが必要な場合のオープンウェイト路線。
  • Breeze TTS 2:本サイトが扱うもう一つの多言語 TTS です。

まとめ

Gemini 3.8 Flash TTS は、音声合成が「プリセット選択」から「デザイン」へ移ったことを最も明確に示す例であり、Google 自身の数値も複数のブラインド評価で首位に置いています。ただし注意点も現実的です。ベンチマークはベンダー測定で、公開価格はなく、8K の入力上限が設計を左右します。独自の声や非英語市場で戦う製品なら、今週の評価リストに入れるべきモデルです。

コメント

まだコメントがありません。最初のコメントを投稿してください!