Breeze TTS 2
Breeze TTS 2 は、BreezeBlueが2026-08-25にウェイトとPyTorch推論コードを公開した、オープンウェイトのテキスト読み上げモデルです。リアルタイム対話向けに作られ、リリース時点でArtificial Analysis TTSリーダーボードのオープンウェイトモデル中1位となり、フロンティアのプロプライエタリシステムも上回りました。単一モデルで英語と中国語を自然に生成し、説明文から声をデザインしたり、クローンした声を文章で指揮したりできます。
主な機能
- 参照なしの音声デザイン:自然言語で声を説明するだけで、参照音声なしで声を作成します。
- 参照ガイドの音声ディレクション:参照音声からクローンしたあと、トーン・感情・テンポ・話し方を文章で調整します。
- 文字起こし付きクローン:参照音声と正確な文字起こしを渡し、声色・リズム・感情・スタイルを保持。
- インラインの感情イベント:英語の
(laugh)、(cough)、(clears throat)、(sigh)、中国語の[笑]、[咳嗽]、[清嗓子]、[叹气]をテキストに直接追加。 - 超低遅延:NVIDIA H100のウォームアップ済みfast pathで初回音声が40ms未満、RTFは0.32(約リアルタイムの3.1倍)。
- GPU効率:遅延推論で約7.7 GiBのメモリ。12GB GPUが推奨の最小構成。
使用シナリオ
このツールを使用すべき人は?
- リアルタイム音声製品:応答の遅れが気になるアシスタントや対話アプリ。
- ゲーム・映像の音声チーム:録音スタジオなしで制御可能な声を得たい小規模チーム。
- ローカライズ担当:英語と中国語を1モデルで扱いたいチーム。
解決する問題
- 遅延が対話感を損なう:40ms未満の初回音声で自然なターンテイキング。
- クローンが脆い:参照ガイドならクローン後も声を微調整でき、再録音が不要。
- サンプルがなくてもデザイン可能:音声デザインはテキスト説明だけで初期の声を作れる。
料金プラン
| 経路 | 費用 | 備考 |
|---|---|---|
| ウェイト + 推論コード | $0 | コードとウェイトをGitHubとHugging Faceで公開。 |
| ライセンス | 非商用 | 推論コードはApache 2.0。ウェイト・派生モデル・セルフホスト出力は研究・非商用のみ。 |
| 計算リソース | 自己負担 | 自分のCUDA GPUで実行。遅延推論で約7.7 GiB。 |
優位性と独自の価値提案
- オープンウェイトTTSで1位:リリース時点でArtificial Analysisで一部クローズドシステムを上回る。
- 2つの制御モード:参照なし音声デザイン、参照ガイド音声ディレクション、加えて従来型クローン。
- 真のバイリンガル:単一モデルで英語と中国語を扱え、2つのウェイトに分かれない。
はじめに
- breezeblue-ai/breeze-tts をクローン。
- BreezeBlue/Breeze-TTS-2 からウェイトを導入。
- 遅延推論なら12GB以上、fast pathなら24GBのCUDA GPUを使用。
- テキストプロンプトから始め、言語に応じたインライン感情イベントを追加。
よくある質問
商用利用できますか?
推論コードはApache 2.0ですが、ウェイト・派生モデル・セルフホスト出力は研究・非商用のみです。製品化の前にライセンスを確認してください。
声を作るのに参照音声は必要ですか?
必須ではありません。音声デザインは自然言語の説明のみ。音声ディレクションとクローンには文字起こし付きの参照音声が必要です。
どの言語に対応していますか?
単一モデルで英語と中国語に対応。
代替案
- Google Gemini 3.1 Flash TTS:言語カバレッジが広い商用フロンティアTTS。
- ElevenLabs Turbo v2.5:プロプライエタリの音声クローン基盤。
- Deepgram Nova 2:音声認識。音声パイプラインの入力側。
ヒントとベストプラクティス
- レイテンシが重要な場合はfast pathを使用するが、24GBのGPUメモリを確保。
- 参照音声には文字起こしを添えると、よりクリーンなクローンが得られる。
- インライン感情イベントは控えめに。多用すると作りこみすぎに聞こえる。
まとめ
Breeze TTS 2 は、オープンウェイトで低遅延、バイリンガルの音声合成モデルです。フロンティア級の音質と制御性を自分のGPU上で実現します。GitHubリポジトリから始め、ライセンスを確認してからリアルタイム音声体験の試作に進みましょう。
Limitation: 公式ドキュメントの代替ではない。依存する前に https://breezeblue.ai/breeze-tts-2 を確認。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Mistral Voxtral TTS
docs.mistral.ai/models
Mistral Voxtral TTS:現行カタログの TTS 行、v 26.03、CC BY-NC 4.0。2026-08-18 再確認。ドル行は作らない。
BGE-M3
huggingface.co/BAAI/bge-m3
2024年BAAI多言語埋め込みスナップショット。再確認:MITカードは残る。2026年のMIRACL/MTEB王冠ではない。
cogvlm-base-490-hf
huggingface.co/THUDM/cogvlm-chat-hf
以前の CogVLM スナップショット。再確認:サイトは誤った DeepSeek-VL カードではなく CogVLM を指す。2026年の VLM 既定ではない。
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。