MiMo-V2.6 是小米 2026 年 9 月发布的模型系列,它主张的核心论点是:继续拉开差距的地方在于强化学习,而不是再训一轮预训练。本次放出的两个检查点都是稀疏混合专家(MoE)模型,上下文窗口均为 100 万 token,并且都采用 MIT 许可,权重可以直接下载而不是锁在接口后面。第一方模型卡 发布于 2026-09-21;2026-09-22 时 Hugging Face 上 Pro 检查点为 19 个赞、Flash 为 16 个赞、蒸馏版本为 18 个赞。它与 MiMo Code 是两条不同的产品线,后者是小米的终端智能体,不是模型。
两个检查点
| MiMo-V2.6-Pro-RL | MiMo-V2.6-Flash-RL | |
|---|---|---|
| 参数量 | 总计 1.02T,激活 42B | 总计 309B,激活 15B |
| 上下文 | 100 万 token | 100 万 token |
| 输入模态 | 文本、图像、视频、音频 | 文本、图像、视频、音频 |
| 许可 | MIT | MIT |
旗舰检查点为 70 层、384 个路由专家、每个 token 激活其中 8 个,注意力采用滑动窗口与全局注意力的混合结构(60 层 SWA,10 层全局)。视觉侧是 681M 参数的 MiMo ViT,音频侧是 308M 的 AudioTokenizer 加 127M 的音频 patch 编码器;解码侧还有一个 5 层多 token 预测(MTP)草稿器,一次前向预测后续 7 个 token 以供并行验证。
这次改了什么
有三个选择和常见的开源权重发布不太一样:
- 一次混合 RL,而不是按领域分别训练。 编码、通用智能体、视觉任务和网络安全在同一条 batch 里训练,还混入了多种 harness,实验室的说法是策略可以迁移到训练中从未见过的 harness 上。
- 大批量异步 GRPO。 每一步使用 1,568 条 prompt × 16 次 rollout,模型卡称单次更新消耗数十亿 token。
- 分组式智能体评分。 二元通过/失败无法给两个都通过的答案排序,所以奖励信号本身被放大:离线阶段用对照 rollout 构造任务专属 rubric,在线阶段把优势分配给更优轨迹。官方目标是更短的路径和更少的每任务 token。
系列还发布了 MiMo-V2.6-Distill-Qwen-9B,一个基于 Qwen3.5-9B 蒸馏出的 9B 学生模型。想在不背上 1T 参数的前提下体验 MiMo 的行为,这是最现实的一条路。
基准成绩
下表数字来自模型卡本身,属于厂商自测,请当作官方评测而非中立排名。
| 基准 | Pro | Flash |
|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 |
| Terminal Bench 2.1 | 89.9 | 87.6 |
| OSWorld-Verified | 82.0 | 80.8 |
| AutomationBench v1.0.6 | 53.1 | 52.3 |
| CyberGym | 94.0 | 95.1 |
同一张表里,Claude Opus 5 在 Terminal Bench 2.1 上是 89.1,GPT-5.6 Sol 是 88.8,差距很小。但 ProgramBench 反过来拉开:Pro 为 26.5,两个闭源模型分别是 37.0 与 25.0。能力在不同领域并不均匀,这恰好是「一次混合 RL」会带来的结果。
部署方式
官方给出了 SGLang 与 vLLM 的部署说明。SGLang 的参考命令是多节点 TP16、DP2、EP16 配置,MoE all-to-all 使用 DeepEP,chunked prefill 为 32768,并启用 EAGLE 推测解码。这意味着一台工作站跑不动,需要数据中心级硬件。如果你要自托管,先看 Flash 这一档。小米自家平台还提供托管 API 和网页版 Studio。
局限与风险
- 推理成本才是真正的门槛。 旗舰档需要多节点张量并行,模型卡给出的示例本身就横跨两个节点。
- 成绩来自厂商自测。 上表所有数字都是实验室自己的评测结果。
- 生态还很新。 发布头几天,量化版本、社区微调和第三方部署指南都还很少。
- 模态能力并不平均。 支持全模态输入,不等于在文本、音频、视频上同样强。
常见问题
MiMo-V2.6 是真开源吗?
是。检查点以 MIT 许可发布,允许商用,权重可以从 Hugging Face 与 ModelScope 下载。
能在本地跑 Pro 吗?
基本不现实。1.02T 总参数、42B 激活仍然需要多卡节点。低于这个规格的场景请用 Flash 或那个 9B 蒸馏模型。
与 MiMo-V2.5 的区别在哪?
这一代的跃升主要在训练侧:跨领域的混合 RL、更大的 RL 批量,以及分组式评分。100 万上下文和全模态输入在 V2 系列里就已经具备。
替代方案
- Qwen3.8-Flash-Next:不需要全模态输入时更轻的开源权重选择。
- LongCat 2.0:另一个长上下文开源模型,值得在智能体基准上对比。
- Bespoke Nimble:面向低成本结构化决策的小模型,而不是通用智能体任务。
总结
MiMo-V2.6 是一次认真的开源权重发布,目标直指智能体场景:100 万上下文、全模态输入、MIT 许可,以及把多个领域混在一次训练里的 RL 配方。问题在算力账上:旗舰档的部署需要多节点集群,所以大多数团队会先评估 Flash 或 9B 蒸馏版,把 Pro 当作这条配方能力上限的参照。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。