Mercury 2.5
Mercury 2.5 は Inception の第 3 世代の本番モデルで、同社が投入した中で最も性能の高い拡散言語モデル(dLLM)です。発表は 2026-09-08。設計上の賭けは同社の初代 Mercury から一貫しています。トークンを 1 つずつ順に出すのではなく、複数のトークンを並列に下書きし、繰り返し精錬します。Inception はこれを「これまでに学習された最大の拡散言語モデル」と説明しており、狙うのは遅延そのものが製品価値になるワークロード、たとえば検索パイプライン、音声エージェント、コーディングのサブエージェントです。
モデル仕様
| 仕様 | Mercury 2.5 |
|---|---|
| アーキテクチャ | 拡散言語モデル(dLLM) |
| コンテキスト | 260K トークン |
| 入力 | テキスト |
| 出力 | テキスト |
| 推論 | 推論エフォートを調整可能 |
| ツール利用 | 並列ツール呼び出し、スキーマ準拠の JSON |
| 速度 | 毎秒 1,107 トークン |
| 公開日 | 2026-09-08 |
260K のコンテキストは 2026 年では中位です。フロンティアは 500K から 1M トークンの範囲にあります。Inception はウィンドウの大きさではなく、1 回の呼び出しがどれだけ速く返るかで競っています。
速度が効く場面
検索リクエスト 1 件は、しばしば数十回のモデル呼び出しに展開します。検索の計画、クエリの書き換え、再ランキング、事実の構造化、要約、そして回答の検証です。Inception の主張は、拡散モデルならその一連を 1 回のユーザー操作の中に収められるというものです。
同社は公開時に 2 つの本番事例を出しています。AI 電話エージェントを手がける OpenCall は、モデル応答のレイテンシ中央値が約 170 ミリ秒だったと報告しました。Augment Code は、コンテキスト圧縮を Mercury に移したことでレイテンシが 82% 減り、約 150 秒から 27 秒になったと述べ、同時にコストも 90% 削減したとしています。
これらはベンダーが伝える顧客の数値なので、方向性の参考として扱ってください。支えているアーキテクチャ上の結論のほうが数値より有用です。効くのは最も頻繁に呼ぶ処理であり、最後に答えを書く 1 回ではありません。
料金
Inception の発表記事には次の料率が記載されています。定価とローンチプロモーションの差に注意してください。
| 項目 | 定価 | ローンチプロモーション |
|---|---|---|
| 入力 | $0.20 / 100 万トークン | $0.04 / 100 万トークン |
| 出力 | $0.75 / 100 万トークン | $0.15 / 100 万トークン |
Artificial Analysis(2026-09-24 時点)は入力を $0.25、出力を $0.75、キャッシュ割引 90% と掲載し、実測の出力速度は毎秒 770.4 トークンでした。Inception 自身の毎秒 1,107 トークンという主張と第三者の 770 という実測の差は、自分のトラフィックで計測すべきだという良いリマインダーです。
第三者のスコアが示すもの
Artificial Analysis は Mercury 2.5 の速度を 175 モデル中 2 位、コストを 21 位とする一方、Intelligence Index は 175 モデル中 91 位でスコアは 12 とし、中央値 13 に対して平均以下と述べています。要約は率直です。知能は平均以下、価格帯としては良好、際立って速い、かなり簡潔。
これがこの取引の実際の形です。Mercury 2.5 はフロンティア推論モデルではなく、フロンティアの判断力が必要な部分はフロンティアモデルに残すべきです。Mercury が買うのは、高価な呼び出しを取り囲む大量で単純な呼び出しのスループットとコストです。
はじめかた
- パイプラインで最も繰り返される呼び出しを選び出します。ルーティング、コンテキスト圧縮、クエリ書き換え、ツール検索の要約、再ランキングなどです。
- それらを Mercury 2.5 に流し、難しい推論は元の場所に残します。
- 変更前後でエンドツーエンドのレイテンシとタスクあたりのコストを測ります。利得は呼び出し頻度から来るのであって、単発の品質からではありません。
- 単純な呼び出しでは推論エフォートを下げます。調整可能な推論が「安い」と「雑」の分かれ目です。
制限
- Intelligence Index は平均以下。 ルーティングとスループットのためのモデルで、フロンティアモデルの代替ではありません。
- テキストのみ。 画像、音声、動画の入力には対応しません。
- コンテキストは 260K。 1M 級の長文タスクには別のモデルが必要です。
- 速度と事例はベンダーによる主張。 毎秒 1,107 トークンは Inception の数値で、Artificial Analysis の実測は 770 です。
- プロモ価格。 ローンチ割引は永遠には続かないので、単位経済は定価で計算してください。
よくある質問
拡散言語モデルとは何ですか?
トークンを厳密に左から右へ生成するのではなく、複数のトークンを並列に生成して精錬します。これが速度とトークン効率の優位の源です。
Mercury 2.5 はフロンティアモデルの代替になりますか?
なりません。第三者のスコアは知能がフロンティア層より明確に低いことを示しています。位置づけはフロンティアモデルを取り囲む高頻度の呼び出しです。
どこで使えますか?
Inception 自身の API に加え、Baseten と OpenRouter です。Inception は API 試用向けに 1 億トークンを無償提供しています。
代替案
- Cohere Command A+:48 言語対応でオープンウェイトの企業向け代替案。
- GPT-6 Luna:速度より知能が必要なときの低コストな準フロンティア選択肢。
- Qwen3.8-Flash-Next:コンテキストがはるかに大きい高スループットの代替案。
まとめ
Mercury 2.5 は、スタック内で最速のモデルとは 1 リクエストにつき何十回も呼ばれるモデルであることが多い、という点を突きつけます。毎秒 770 から 1,107 トークンという速度は、現在市場に出ている推論モデルの中で最速級です。第三者のスコアは、これがフロンティアモデルではないことも明確に示しています。したがって価値は配置の仕方に完全に依存します。反復的な呼び出しをここに流し、判断を要する呼び出しは他所に残し、単発ではなくパイプライン全体で計測してください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
ローコードプラットフォームの黄昏:なぜClaude Agent SDKがDifyを歴史にするのか
大規模言語モデルの第一原理から、なぜClaude Agent SDKがDifyを置き換えるのかを深く分析。自然言語でプロセスを記述することが人間の原始的な行動パターンにより合致している理由、そしてなぜこれがAI時代の必然的な選択なのかを探る。
Skills + Hooks + Plugins:AnthropicによるAIコーディングツールの拡張性の再定義
Claude CodeのSkills、Hooks、Pluginsという三位一体アーキテクチャを深く分析し、なぜこの設計がGitHub CopilotやCursorよりも先進的なのか、そしてオープンスタンダードを通じてAIコーディングツールの拡張性をどのように再定義しているかを探ります。