MiMo-V2.6 は Xiaomi が 2026 年 9 月に公開したモデルシリーズで、その中心的な主張は「さらなる差は事前学習の追加ではなく強化学習から生まれる」という点にあります。公開された 2 つのチェックポイントはいずれもスパースな Mixture-of-Experts モデルで、100 万トークンのコンテキストウィンドウを持ち、MIT ライセンスで配布されるため、重みはエンドポイントの背後に閉じ込められずダウンロードできます。第一者モデルカード は 2026-09-21 に公開され、2026-09-22 時点の Hugging Face では Pro が 19 likes、Flash が 16 likes、蒸留版が 18 likes でした。MiMo Code とは別系統で、あちらは Xiaomi のターミナルエージェントでありモデルではありません。
2 つのチェックポイント
| MiMo-V2.6-Pro-RL | MiMo-V2.6-Flash-RL | |
|---|---|---|
| パラメータ | 総 1.02T / 活性 42B | 総 309B / 活性 15B |
| コンテキスト | 100 万トークン | 100 万トークン |
| 入力 | テキスト・画像・動画・音声 | テキスト・画像・動画・音声 |
| ライセンス | MIT | MIT |
旗艦の Pro は 70 層で 384 個のルーティングエキスパートを持ち、トークンごとに 8 個を活性化します。アテンションはスライディングウィンドウとグローバルの混成(SWA 60 層、グローバル 10 層)です。視覚側は 681M パラメータの MiMo ViT、音声側は 308M の AudioTokenizer と 127M の音声パッチエンコーダが担当します。さらに 5 層の Multi-Token Prediction ドラフタが次の 7 トークンを予測し、デコード時に並列検証します。
今回の変更点
一般的なオープンウェイト公開と異なる選択が 3 つあります。
- 領域ごとではなく 1 回の混合 RL。 コーディング、汎用エージェント、視覚タスク、サイバーセキュリティを同一バッチで学習し、複数のハーネスも混在させます。ラボの主張では、学習で見ていないハーネスにも戦略が転移します。
- 大規模バッチの非同期 GRPO。 1 ステップあたり 1,568 プロンプト × 16 ロールアウトを使い、モデルカードでは 1 更新あたり数十億トークンと説明されています。
- グループ単位のエージェント型採点。 二値の合否では通過した 2 つの解を順位付けできないため、報酬信号そのものを拡張します。オフラインで対照的なロールアウトからタスク固有のルーブリックを構築し、オンラインで優れた軌跡へアドバンテージを寄せます。狙いは短い経路とタスクあたりのトークン削減です。
さらに MiMo-V2.6-Distill-Qwen-9B も公開されています。Qwen3.5-9B を土台に蒸留した 9B の生徒モデルで、1T パラメータを抱えずに MiMo の挙動を試す現実的な手段です。
ベンチマーク
下表はモデルカード由来、つまりラボ自身の評価です。中立なランキングではなくベンダー計測として読んでください。
| ベンチマーク | Pro | Flash |
|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 |
| Terminal Bench 2.1 | 89.9 | 87.6 |
| OSWorld-Verified | 82.0 | 80.8 |
| AutomationBench v1.0.6 | 53.1 | 52.3 |
| CyberGym | 94.0 | 95.1 |
同じ表で Claude Opus 5 は Terminal Bench 2.1 が 89.1、GPT-5.6 Sol が 88.8 とほぼ並びます。一方 ProgramBench は逆に開き、Pro が 26.5 に対してクローズドな 2 モデルは 37.0 と 25.0 です。能力は領域ごとにばらついており、これは 1 回の混合 RL という設計から予想される通りの結果です。
デプロイ
SGLang と vLLM の手順が公開されています。SGLang のリファレンス構成はマルチノードの TP16・DP2・EP16 で、MoE の all-to-all に DeepEP、chunked prefill 32768、EAGLE 投機的デコードを使います。つまりワークステーション 1 台ではなくデータセンター向けのハードウェアが前提です。セルフホストするならまず Flash を検討してください。Xiaomi 自身のプラットフォームではホスト型 API とブラウザ版 Studio も提供されています。
制約とリスク
- 実質的な障壁は推論コスト。 旗艦はマルチノードのテンソル並列が必要で、モデルカードの例自体が 2 ノードにまたがります。
- ベンチマークはベンダー計測。 上表の数値はすべてラボ自身の評価です。
- エコシステムはまだ薄い。 公開直後は量子化版、コミュニティのファインチューン、第三者の配備ガイドがほとんどありませんでした。
- モダリティ能力は均一ではない。 オムニモーダル入力は、テキスト・音声・動画で同等に強いことを意味しません。
よくある質問
MiMo-V2.6 は本当にオープンですか?
はい。チェックポイントは MIT ライセンスで公開され商用利用も可能で、重みは Hugging Face と ModelScope から取得できます。
ローカルで Pro を動かせますか?
現実的には難しく、総 1.02T・活性 42B はマルチ GPU ノードを要求します。それ未満の環境では Flash か 9B 蒸留モデルを使ってください。
MiMo-V2.5 との違いは?
主な跳躍は学習側です。領域をまたぐ混合 RL、はるかに大きな RL バッチ、グループ単位の採点。100 万コンテキストとオムニモーダル入力は V2 系ですでに用意されていました。
代替案
- Qwen3.8-Flash-Next:オムニモーダル入力が不要なときの軽量なオープンウェイト候補。
- LongCat 2.0:エージェント系ベンチマークで比較したいもう 1 つの長文脈オープンモデル。
- Bespoke Nimble:汎用エージェントではなく低コストな構造化判断に向けた小型モデル。
まとめ
MiMo-V2.6 はエージェント用途に照準を合わせた本格的なオープンウェイト公開です。100 万コンテキスト、オムニモーダル入力、MIT ライセンス、そして複数領域を 1 回の学習に混ぜる RL レシピ。課題は算術にあります。旗艦の配備にはマルチノードクラスタが必要なため、多くのチームは Flash か 9B 蒸留版を評価し、Pro はこのレシピが到達しうる上限の参照点として扱うことになるでしょう。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
Claude Skills 完全ガイド - 必須10大 Skills 徹底解説
Claude Skills の拡張メカニズムを深掘りし、10の中核スキルと Obsidian 連携を詳しく解説。高効率な AI ワークフロー構築を支援します
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。