9 月 22 日,小米发布并开源了 MiMo-V2.6 系列。这次发布有两个不寻常之处:一是模型本身是原生全模态的,二是小米把 RL 训练的生产运行全程直播了出来,并连同完整技术报告、训练环境和 RL 代码一起开源。

系列包含三款模型:MiMo-V2.6-Pro(最强)、MiMo-V2.6-Flash(智能、效率与成本的最佳平衡),以及正在推送的 MiMo-V2.6-Pro-UltraSpeed(同等质量下输出速度最高提升 20 倍)。

性能:46.32 的智能指数,登顶开源第一

按照 Artificial Analysis 的 Intelligence Index v4.3,MiMo-V2.6-Pro 拿到 46.32,超过 Kimi K3 与 Qwen3.8 Max,成为目前得分最高的开源模型。更关键的一点是:这一代的 API 定价与 MiMo-V2.5 系列完全一致,也就是在同样的价格上提供了更高的智能水平,把”智能—成本”的帕累托前沿又向外推了一格。

在具体基准上,MiMo-V2.6-Pro 的位置是”全面接近第一梯队,超越上一代一大截”:

基准MiMo-V2.6-ProMiMo-V2.6-FlashMiMo-V2.5-Pro该基准最高分
DeepSWE v1.1(编码)71.967.919.074.2(DeepSeek V4.1 Flash)
ProgramBench26.526.012.537.0(Claude Opus 5)
Toolathlon-verified76.973.649.180.6(Claude Opus 5)
Automation Bench v1.0.653.152.316.054.8(DeepSeek V4.1 Flash)
Agents’ Last Exam31.627.613.234.2(GPT 6 Astra)
Terminal Bench 4.034.928.81.559.6(GPT 6 Astra)
GDPVal 2.1(Elo)1673—11071735(Claude Fable 5.1)
MiMo Visual Coding72.371.5—82.2(GPT 6 Astra)
CyberGym94.095.140.095.1(MiMo-V2.6-Flash)

几个值得单独点出的地方:Automation Bench 上 Pro 的 53.1 超过了 Claude Opus 5 的 50.3、GPT 6 Astra 的 52.0 与 Claude Fable 5 的 46.2;网络攻防基准 CyberGym 上,最快最便宜的 Flash 反而以 95.1 拿下全场第一,Pro 的 94.0 紧随其后,把 GLM 5.3(84.5)与 DeepSeek V4.1 Flash(88.1)甩在身后。相对地,在 Terminal Bench 4.0、ExploitBench 这类偏终端/利用链的基准上,MiMo 与 GPT 6 Astra 仍有明显差距。原文附录给出了完整对比集:Terminal Bench 2.1 上 Pro / Flash 为 89.9 / 87.6,JobBench 为 62.0 / 61.2,OSWorld-Verified 为 82.0 / 80.8;但 ExploitBench 的 47.9、SEC Bench Pro 的 66.3 说明在漏洞利用链与安全专业场景上仍有短板。

MiMo-V2.6 关键基准对比

六个昼夜的 RL 训练:一次被直播的规模化实验

小米把这次 RL 训练称为”RSI 路径上的关键一步”——在可验证的复杂任务上规模化 RL 算力,让模型通过探索与反馈持续拓展能力边界。整个生产训练过程对外直播,结果如下:

  • 不到六天,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 各完成 30 步 RL,各消耗约 75 万条轨迹
  • 成本分别约为 85 万美元(Flash)与 262 万美元(Pro)
  • 训练任务上的平均通过率相对提升 25%(Flash)与 12%(Pro)
  • 在留出的长时程软件工程基准 DeepSWE v1.1 上,分数分别上涨约 17 分(48.8 → 65.68)与 14 分(58.4 → 72.57)

用作者的话说,这次 RL”样本效率高、全程持续改善,并且泛化到了训练分布之外”——留出基准上的涨幅证明了最后一点。

直播曲线里另外两栏也值得看:通用工作流基准 Automation Bench v1.0.6 上,Pro 从 46.5 升到 55.0、Flash 从 45.2 升到 52.7;视觉任务基准 MiMo Visual Coding 上,Pro 从 68.5 升到 74.9、Flash 从 65.3 升到 72.9。同时长时程任务的算力开销也在涨——同一张图上,DeepSWE v1.1 评测消耗的总 token 从约 13.9 万升到 21.4 万,说明策略在难题上探索得更久。

RL 训练 30 步的进展曲线

规模化沿三条轴展开:

  1. 更大的批与更高吞吐:在全异步架构上使用大批量,每次更新 1,568 个样本,训练上下文最长达 1M,每步 3.5–3.7B token
  2. 更多任务与更丰富的环境:训练套件横跨编码、通用智能体、视觉与网络攻防,并在多套 harness 之间混合,使某一能力的增益能反哺其他能力
  3. 更多评分算力:组内相对比较为长时程 RL 任务提供了更精确、更多样的奖励信号,闭合自我改进循环,并把模型推向更短的路径与更少的每任务 token

随着训练规模上升,团队冻结了 router 以抑制训练漂移,并构建了一套跨越奖励设计、对抗评估、异常检测与验证器交叉检查的防奖励黑客(reward hacking)体系。工程侧则设计了统一的轨迹表示与惩罚机制以提供更细粒度的学习信号,支持多智能体框架的高并发交互,把控制面与数据面解耦以支撑大规模轨迹迁移,稳定混合批次内的每任务采样比例,并同时优化训练与推理引擎及两者之间的一致性。

这套东西连同技术报告、训练环境与 RL 代码一并开源。

从 Vibe Coding 到 Vibe World

MiMo 的编码能力已经泛化到软件工程之外。官方给它的定位是:给定目标、harness 与时间,它能承担真实的生产性工作——构建、测试、交付,并持续产出经济价值。V2.6 把 3D 空间推理、多模态感知与计算机使用智能体(CUA)能力合到一起,把”自然语言驱动编程”从造软件扩展到造可交互的世界,也就是官方所说的 Vibe World。

MiMo-V2.6 的能力版图:从编码到 Vibe World

  • 游戏开发:给定图片、视频或文本提示,模型把需求拆成多个任务、协调多个智能体搭建 3D 场景、实现交互逻辑并做视觉验证,再依据渲染结果迭代,最终产出可运行、符合意图的交互世界
  • 3D 建模:在 Blender 中依文字描述或参考图生成 3D 物体与场景,可用于动画、3D 打印与游戏开发
  • 具身仿真:直接以多视角相机画面为输入,持续推理与决策,通过视觉反馈闭环控制 Franka Panda 机械臂完成抓取、颜色匹配与精确放置
  • 视觉与设计:把一句话变成完整的前端界面或幻灯片,包含结构化布局、组件设计、交互元素与动画;同时熟用 Figma 与图像/视频生成工具,保持排版、色彩与图文关系的连贯
  • 视频剪辑:端到端完成创意与产品宣传片的视觉设计、镜头与运动编排、配乐以及卡点剪辑;教学视频中可把傅里叶分解这类抽象概念转成动画讲解,并用 MiMo-V2.5-TTS 生成与画面精确对齐的旁白
  • 音乐创作:这是模型首次涉足作曲,官方称已能写出 demo 级作品。案例中 Pro 受命写作一首约十件乐器的管弦乐《Night Road》(弦乐、双簧管、单簧管、小号、长号、圆号、钟琴与定音鼓),自行完成配器并转成 MIDI 后在 DAW 中回放;另有 A 小调的慢速与中速两首钢琴曲,展示了对力度、织体等作曲要素的把握

研究:从”永久化学品”到 Lean 4

即便没有专门为科研做 RL 调优,MiMo-V2.6 也已经在科研任务上显出可用性:

  • 材料研究的协同科学家:小米材料专家经过多轮提示,让 Pro 设计一种能吸附 PFAS(全氟和多氟烷基物质,即”永久化学品”)的全新金属有机框架(MOF)材料。模型完成了网络检索、文献与专利梳理、提出假设并评估新颖性,随后进入”干实验”:调用开源计算工具、自动搭建仿真环境、计算 MOF 与 PFAS 的结合强度,筛选出值得进入湿实验室的候选。案例给出了三种 UiO-67 型 Zr₆ 骨架的孔壁配体差异,PFOA 客体吸附能约 −2.78 eV、N⁺···PFO⁻ 距离约 3.90 Å(完整案例)
  • 数学证明形式化:Pro 协助研究者完成 Li 与 Yorke 经典论文《Period Three Implies Chaos》主定理的 Lean 4 完整形式化——该定理指出,区间连续自映射若存在周期三轨道,则存在任意正整数周期的周期轨道以及一个不可数的乱序集。模型以子智能体协作推进定理陈述与证明,项目最终超过 6,000 行 Lean 源码,由 Lean 内核验证通过、没有遗留未完成的证明占位符。值得注意的是模型没有接受过 Lean 专项后训练,因此这更多是通用能力外溢的展示(Lean 代码下载)

可用性与定价

MiMo-V2.6-Pro 与 Flash 即日起可在 AI Studio、MiMo Code、MiMo Desktop、MiMo API Platform 与 OpenRouter 上使用。MiMo Desktop 同时结束早期访问、发布首个正式版,并内置了两款模型与 Pro-UltraSpeed 模式;早期访问计划还会再运行一周,已有权限的用户需要切换到新的模型名才能继续使用。针对可预测的高流量场景,小米另有一个 Token Plan 套餐。

API 价格与 V2.5 系列持平(美元 / 百万 token):

模型输入(缓存命中)输入(缓存未命中)输出
MiMo-V2.6-Flash$0.0028$0.14$0.28
MiMo-V2.6-Pro$0.0036$0.435$0.87
MiMo-V2.6-Pro-UltraSpeed$0.036$4.35$8.7

UltraSpeed 的定价正好是 Pro 的 10 倍——它为实时交互和对响应时间敏感的流程换取最高 20 倍的输出速度。缓存写入目前限时免费。

核心总结

  • 开源第一:MiMo-V2.6-Pro 在 Artificial Analysis 智能指数上拿到 46.32,超过 Kimi K3 与 Qwen3.8 Max,且 API 价格与上一代持平
  • RL 全程直播:不到六天、各 30 步、各约 75 万条轨迹,成本约 85 万 / 262 万美元,DeepSWE v1.1 分别提升约 17 分与 14 分并泛化到留出集
  • 规模化三轴:每次更新 1,568 样本、最长 1M 上下文、每步 3.5–3.7B token,配组内相对奖励与防奖励黑客体系
  • 全模态而非拼装:原生全模态基座支撑从编码到游戏、3D、具身、设计与音乐的 Vibe World
  • 开源到底:技术报告、训练环境与 RL 代码一并放出,Flash 在 CyberGym 上以 95.1 拿下全场第一

原文:Introducing MiMo-V2.6 series(Xiaomi MiMo Team,2026-09-22)