MiMo-V2.6 logo

MiMo-V2.6

打开

小米 MiMo-V2.6 开源权重系列:旗舰 Pro 为 1.02T 总参数、42B 激活的稀疏 MoE,另有 309B 的 Flash 版本,两者均 MIT 许可并支持百万 token 上下文。

分享:
查看替代方案

MiMo-V2.6 是小米 2026 年 9 月发布的模型系列,它主张的核心论点是:继续拉开差距的地方在于强化学习,而不是再训一轮预训练。本次放出的两个检查点都是稀疏混合专家(MoE)模型,上下文窗口均为 100 万 token,并且都采用 MIT 许可,权重可以直接下载而不是锁在接口后面。第一方模型卡 发布于 2026-09-21;2026-09-22 时 Hugging Face 上 Pro 检查点为 19 个赞、Flash 为 16 个赞、蒸馏版本为 18 个赞。它与 MiMo Code 是两条不同的产品线,后者是小米的终端智能体,不是模型。

两个检查点

MiMo-V2.6-Pro-RL MiMo-V2.6-Flash-RL
参数量 总计 1.02T,激活 42B 总计 309B,激活 15B
上下文 100 万 token 100 万 token
输入模态 文本、图像、视频、音频 文本、图像、视频、音频
许可 MIT MIT

旗舰检查点为 70 层、384 个路由专家、每个 token 激活其中 8 个,注意力采用滑动窗口与全局注意力的混合结构(60 层 SWA,10 层全局)。视觉侧是 681M 参数的 MiMo ViT,音频侧是 308M 的 AudioTokenizer 加 127M 的音频 patch 编码器;解码侧还有一个 5 层多 token 预测(MTP)草稿器,一次前向预测后续 7 个 token 以供并行验证。

这次改了什么

有三个选择和常见的开源权重发布不太一样:

  1. 一次混合 RL,而不是按领域分别训练。 编码、通用智能体、视觉任务和网络安全在同一条 batch 里训练,还混入了多种 harness,实验室的说法是策略可以迁移到训练中从未见过的 harness 上。
  2. 大批量异步 GRPO。 每一步使用 1,568 条 prompt × 16 次 rollout,模型卡称单次更新消耗数十亿 token。
  3. 分组式智能体评分。 二元通过/失败无法给两个都通过的答案排序,所以奖励信号本身被放大:离线阶段用对照 rollout 构造任务专属 rubric,在线阶段把优势分配给更优轨迹。官方目标是更短的路径和更少的每任务 token。

系列还发布了 MiMo-V2.6-Distill-Qwen-9B,一个基于 Qwen3.5-9B 蒸馏出的 9B 学生模型。想在不背上 1T 参数的前提下体验 MiMo 的行为,这是最现实的一条路。

基准成绩

下表数字来自模型卡本身,属于厂商自测,请当作官方评测而非中立排名。

基准 Pro Flash
DeepSWE v1.1 71.9 67.9
Terminal Bench 2.1 89.9 87.6
OSWorld-Verified 82.0 80.8
AutomationBench v1.0.6 53.1 52.3
CyberGym 94.0 95.1

同一张表里,Claude Opus 5 在 Terminal Bench 2.1 上是 89.1,GPT-5.6 Sol 是 88.8,差距很小。但 ProgramBench 反过来拉开:Pro 为 26.5,两个闭源模型分别是 37.0 与 25.0。能力在不同领域并不均匀,这恰好是「一次混合 RL」会带来的结果。

部署方式

官方给出了 SGLang 与 vLLM 的部署说明。SGLang 的参考命令是多节点 TP16、DP2、EP16 配置,MoE all-to-all 使用 DeepEP,chunked prefill 为 32768,并启用 EAGLE 推测解码。这意味着一台工作站跑不动,需要数据中心级硬件。如果你要自托管,先看 Flash 这一档。小米自家平台还提供托管 API 和网页版 Studio。

局限与风险

  • 推理成本才是真正的门槛。 旗舰档需要多节点张量并行,模型卡给出的示例本身就横跨两个节点。
  • 成绩来自厂商自测。 上表所有数字都是实验室自己的评测结果。
  • 生态还很新。 发布头几天,量化版本、社区微调和第三方部署指南都还很少。
  • 模态能力并不平均。 支持全模态输入,不等于在文本、音频、视频上同样强。

常见问题

MiMo-V2.6 是真开源吗?

是。检查点以 MIT 许可发布,允许商用,权重可以从 Hugging Face 与 ModelScope 下载。

能在本地跑 Pro 吗?

基本不现实。1.02T 总参数、42B 激活仍然需要多卡节点。低于这个规格的场景请用 Flash 或那个 9B 蒸馏模型。

与 MiMo-V2.5 的区别在哪?

这一代的跃升主要在训练侧:跨领域的混合 RL、更大的 RL 批量,以及分组式评分。100 万上下文和全模态输入在 V2 系列里就已经具备。

替代方案

  • Qwen3.8-Flash-Next:不需要全模态输入时更轻的开源权重选择。
  • LongCat 2.0:另一个长上下文开源模型,值得在智能体基准上对比。
  • Bespoke Nimble:面向低成本结构化决策的小模型,而不是通用智能体任务。

总结

MiMo-V2.6 是一次认真的开源权重发布,目标直指智能体场景:100 万上下文、全模态输入、MIT 许可,以及把多个领域混在一次训练里的 RL 配方。问题在算力账上:旗舰档的部署需要多节点集群,所以大多数团队会先评估 Flash 或 9B 蒸馏版,把 Pro 当作这条配方能力上限的参照。

评论

还没有评论。成为第一个评论的人!