MiMo-V2.6 logo

MiMo-V2.6

開く

Xiaomi の MiMo-V2.6 オープンウェイトシリーズ。旗艦 Pro は総 1.02T・活性 42B のスパース MoE、Flash は 309B。両方 MIT ライセンスで 100 万トークン対応。

共有:
代替ツールを見る

MiMo-V2.6 は Xiaomi が 2026 年 9 月に公開したモデルシリーズで、その中心的な主張は「さらなる差は事前学習の追加ではなく強化学習から生まれる」という点にあります。公開された 2 つのチェックポイントはいずれもスパースな Mixture-of-Experts モデルで、100 万トークンのコンテキストウィンドウを持ち、MIT ライセンスで配布されるため、重みはエンドポイントの背後に閉じ込められずダウンロードできます。第一者モデルカード2026-09-21 に公開され、2026-09-22 時点の Hugging Face では Pro が 19 likes、Flash が 16 likes、蒸留版が 18 likes でした。MiMo Code とは別系統で、あちらは Xiaomi のターミナルエージェントでありモデルではありません。

2 つのチェックポイント

MiMo-V2.6-Pro-RL MiMo-V2.6-Flash-RL
パラメータ 総 1.02T / 活性 42B 総 309B / 活性 15B
コンテキスト 100 万トークン 100 万トークン
入力 テキスト・画像・動画・音声 テキスト・画像・動画・音声
ライセンス MIT MIT

旗艦の Pro は 70 層で 384 個のルーティングエキスパートを持ち、トークンごとに 8 個を活性化します。アテンションはスライディングウィンドウとグローバルの混成(SWA 60 層、グローバル 10 層)です。視覚側は 681M パラメータの MiMo ViT、音声側は 308M の AudioTokenizer と 127M の音声パッチエンコーダが担当します。さらに 5 層の Multi-Token Prediction ドラフタが次の 7 トークンを予測し、デコード時に並列検証します。

今回の変更点

一般的なオープンウェイト公開と異なる選択が 3 つあります。

  1. 領域ごとではなく 1 回の混合 RL。 コーディング、汎用エージェント、視覚タスク、サイバーセキュリティを同一バッチで学習し、複数のハーネスも混在させます。ラボの主張では、学習で見ていないハーネスにも戦略が転移します。
  2. 大規模バッチの非同期 GRPO。 1 ステップあたり 1,568 プロンプト × 16 ロールアウトを使い、モデルカードでは 1 更新あたり数十億トークンと説明されています。
  3. グループ単位のエージェント型採点。 二値の合否では通過した 2 つの解を順位付けできないため、報酬信号そのものを拡張します。オフラインで対照的なロールアウトからタスク固有のルーブリックを構築し、オンラインで優れた軌跡へアドバンテージを寄せます。狙いは短い経路とタスクあたりのトークン削減です。

さらに MiMo-V2.6-Distill-Qwen-9B も公開されています。Qwen3.5-9B を土台に蒸留した 9B の生徒モデルで、1T パラメータを抱えずに MiMo の挙動を試す現実的な手段です。

ベンチマーク

下表はモデルカード由来、つまりラボ自身の評価です。中立なランキングではなくベンダー計測として読んでください。

ベンチマーク Pro Flash
DeepSWE v1.1 71.9 67.9
Terminal Bench 2.1 89.9 87.6
OSWorld-Verified 82.0 80.8
AutomationBench v1.0.6 53.1 52.3
CyberGym 94.0 95.1

同じ表で Claude Opus 5 は Terminal Bench 2.1 が 89.1、GPT-5.6 Sol が 88.8 とほぼ並びます。一方 ProgramBench は逆に開き、Pro が 26.5 に対してクローズドな 2 モデルは 37.0 と 25.0 です。能力は領域ごとにばらついており、これは 1 回の混合 RL という設計から予想される通りの結果です。

デプロイ

SGLang と vLLM の手順が公開されています。SGLang のリファレンス構成はマルチノードの TP16・DP2・EP16 で、MoE の all-to-all に DeepEP、chunked prefill 32768、EAGLE 投機的デコードを使います。つまりワークステーション 1 台ではなくデータセンター向けのハードウェアが前提です。セルフホストするならまず Flash を検討してください。Xiaomi 自身のプラットフォームではホスト型 API とブラウザ版 Studio も提供されています。

制約とリスク

  • 実質的な障壁は推論コスト。 旗艦はマルチノードのテンソル並列が必要で、モデルカードの例自体が 2 ノードにまたがります。
  • ベンチマークはベンダー計測。 上表の数値はすべてラボ自身の評価です。
  • エコシステムはまだ薄い。 公開直後は量子化版、コミュニティのファインチューン、第三者の配備ガイドがほとんどありませんでした。
  • モダリティ能力は均一ではない。 オムニモーダル入力は、テキスト・音声・動画で同等に強いことを意味しません。

よくある質問

MiMo-V2.6 は本当にオープンですか?

はい。チェックポイントは MIT ライセンスで公開され商用利用も可能で、重みは Hugging Face と ModelScope から取得できます。

ローカルで Pro を動かせますか?

現実的には難しく、総 1.02T・活性 42B はマルチ GPU ノードを要求します。それ未満の環境では Flash か 9B 蒸留モデルを使ってください。

MiMo-V2.5 との違いは?

主な跳躍は学習側です。領域をまたぐ混合 RL、はるかに大きな RL バッチ、グループ単位の採点。100 万コンテキストとオムニモーダル入力は V2 系ですでに用意されていました。

代替案

  • Qwen3.8-Flash-Next:オムニモーダル入力が不要なときの軽量なオープンウェイト候補。
  • LongCat 2.0:エージェント系ベンチマークで比較したいもう 1 つの長文脈オープンモデル。
  • Bespoke Nimble:汎用エージェントではなく低コストな構造化判断に向けた小型モデル。

まとめ

MiMo-V2.6 はエージェント用途に照準を合わせた本格的なオープンウェイト公開です。100 万コンテキスト、オムニモーダル入力、MIT ライセンス、そして複数領域を 1 回の学習に混ぜる RL レシピ。課題は算術にあります。旗艦の配備にはマルチノードクラスタが必要なため、多くのチームは Flash か 9B 蒸留版を評価し、Pro はこのレシピが到達しうる上限の参照点として扱うことになるでしょう。

コメント

まだコメントがありません。最初のコメントを投稿してください!