Mercury 2 logo

Mercury 2

開く

Inception の拡散推論モデル。128K コンテキスト、並列生成で毎秒約 1,000 トークン、入力は 100 万トークンあたり 0.25 ドル。現在は Mercury 2.5 が後継です。

共有:
代替ツールを見る

Mercury 2

Mercury 2 は Inception の拡散言語モデルで、同社の並列デコード路線を実際のプロダクション利用まで押し進めたリリースです。Inception は 2026 年 2 月に発表しており、公式ブログの主張はスコアではなく曲線にあります。自己回帰モデルはトークンを左から右へ 1 つずつ書きますが、Mercury はまとめて生成し、少ないステップで全体を収束させます。同社はこれをタイプライターではなく編集者にたとえています。

これが効くのはループの中です。エージェント、検索パイプライン、抽出ジョブは 1 タスクあたり数十回の推論を呼び出し、遅延は各ステップ、各ユーザー、各リトライで積み上がります。Mercury 2 の主張は、推論品質をリアルタイムの遅延予算に収めれば、実行できるステップ数そのものが変わるところにあります。

Mercury 2 は Mercury 2.5 に後を譲っています。後継は 2026-09-08 に公開され、コンテキストは 260K に拡大しました。Mercury 2 は同じ定価で API から引き続き利用でき、サードパーティの遅延ベンチマークが今も参照するのはこの版です。

モデル仕様

仕様 Mercury 2
アーキテクチャ 拡散言語モデル(dLLM)
コンテキスト 128K トークン(chat)
最大出力 50,000 トークン
入力 / 出力 テキスト
推論 reasoning effort を調整可能
エンドポイント v1/chat/completions
機能 ツール呼び出し、構造化出力
公開 2026 年 2 月

料金

Inception の公式ドキュメントに記載された Mercury 2 の価格です。

項目 価格
入力 $0.25 / 100 万トークン
キャッシュ入力 $0.025 / 100 万トークン
出力 $0.75 / 100 万トークン

Mercury 2 には現在プロモーション価格はなく、Inception が宣伝している 80% オフは Mercury 2.5 が対象です。Mercury 2 は OpenAI API 互換なので、既存クライアントを https://api.inceptionlabs.ai/v1 に向けるのは設定変更であり、書き直しではありません。

第三者評価

Artificial Analysis の 2026-09-25 時点のページは Mercury 2 の公開月を 2026 年 2 月とし、すでに deprecated として Mercury 2.5 を推奨しています。それでも実測値は最も有用な比較材料です。

  • 速度: 毎秒 761.4 出力トークンで 174 モデル中 3 位。
  • 知能: Artificial Analysis インテリジェンス指数 14、174 モデル中 77 位で中央値 13 を上回ります。
  • 価格: 入力 $0.25、出力 $0.75、キャッシュ割引 90%。
  • コンテキスト: 128K トークン、テキスト入力とテキスト出力。

Inception 自身は NVIDIA Blackwell で毎秒 1,009 トークンと主張しており、第三者の 761 との差はよくあるベンダー値とベンチマークの差です。数字そのものより傾向を見てください。

速度が効く場面

発表記事には複数のプロダクション事例が集められています。いずれもベンダー申告なので方向性として扱ってください。

  • Zed は next-edit の提案とリファクタに使い、待ち時間が開発者の流れを切らないようにしています。
  • Wispr Flow はリアルタイムの文字起こし整形と対話的アプリケーションに使っています。
  • Skyvern は Mercury 2 が GPT-5.2 の少なくとも 2 倍速いと述べ、ブラウザ自動化では状況を変えるものだと評価しました。
  • Viant は数十回連なる推論呼び出しからなる広告配信の最適化に使っています。
  • SearchBlox はカスタマーサポート、コンプライアンス、EC 検索でサブ秒の知能を動かしています。
  • OpenCall の音声エージェントは応答遅延の中央値が約 170 ミリ秒だと報告しました。

NVIDIA の Shruti Koparkar のコメントも掲載され、この性能を Blackwell 基盤と結びつけています。

はじめかた

  1. Inception コンソールで API キーを作成し、INCEPTION_API_KEY として環境変数に設定します。
  2. https://api.inceptionlabs.ai/v1/chat/completions に model: "mercury-2"、reasoning_effort、max_completion_tokens を付けてリクエストします。
  3. パイプラインで最も繰り返される呼び出しを探します。ルーティング、コンテキスト圧縮、クエリ書き換え、リランキング、ツール結果の要約が該当します。
  4. 呼び出し単位ではなく、タスク単位のエンドツーエンド遅延とコストを前後で測ります。

制限とリスク

  • 後継に置き換え済み。 Mercury 2.5 はコンテキストが倍以上、知能指数も高く、プロモーション価格もあります。新規導入はそちらから始めるべきです。
  • 知能は最前線ではない。 指数 14 は平均超ですがフロンティアモデルではありません。難しい推論はフロンティアモデルに残してください。
  • テキストのみ、128K コンテキスト。 画像や音声の入力はなく、50 万から 100 万トークンの長文脈は別モデルが必要です。
  • 速度はベンダー申告。 毎秒 1,009 トークンは Inception 自身の測定値です。
  • 出力上限。 1 リクエストあたり 50,000 出力トークンで、Mercury 2.5 の 65,536 より少なめです。

よくある質問

Mercury 2.5 が出た今も Mercury 2 は使えますか?

使えます。Inception は v1/chat/completions で 100 万トークンあたり $0.25 / $0.75 で提供を続けており、Artificial Analysis も既定ワークロードの速度計測を継続しています。

クライアントを入れ替える必要はありますか?

ありません。OpenAI API 互換なので、多くの SDK はベース URL とモデル名の変更だけで動きます。

拡散言語モデルとは何ですか?

多くの LLM はトークンを順番に 1 つずつデコードします。拡散言語モデルは多数のトークンを並列に生成し、数ステップで収束させます。だから Inception は「ハードウェアが速い」ではなく「曲線が違う」と言えるのです。

フロンティアモデルの代わりになりますか?

なりません。価値は高価な呼び出しを囲む大量の呼び出しのスループットとコストにあり、難問の最終回答品質ではありません。

代替案

  • Mercury 2.5: 後継。260K コンテキストで、現在の割引もこちらが対象です。
  • Claude Opus 5.5: 遅延より判断力が重要な呼び出しに向くフロンティアモデル。
  • Grok 4.7: 同世代の選択肢のひとつで、コンテキストははるかに大きい。

ヒント

  1. システムプロンプトと安定した長いコンテキストをリクエストの先頭に置き、90% のキャッシュ割引を活かします。
  2. ルーティングや分類では reasoning effort を下げます。調整可能な推論がコスト曲線を平坦に保つ鍵です。
  3. 本格導入の前に Mercury 2.5 と比較してください。価格と品質のバランスは後継に軍配が上がります。

まとめ

Mercury 2 は、拡散言語モデルが遅延ベンチマークで勝つだけでなく本番トラフィックを支えられることを示したモデルであり、Zed、Skyvern、SearchBlox の事例がその証拠です。Mercury 2.5 の登場により第一候補ではなくなりましたが、すでに運用しているチームや、この速度の議論がどこから始まったかを知りたい人にとって、カタログに残す価値はあります。

コメント

まだコメントがありません。最初のコメントを投稿してください!