7.1
深览指数
科技Bestblogs·Xiaomi MiMo··AI 生成

Xiaomi MiMo-V2.6:扩展强化学习,迈向自我提升

小米发布 MiMo-V2.6 系列全模态模型,核心创新在于通过规模化强化学习(RL)探索递归自我改进(RSI)路径。模型在 AA 综合智能指数中得 46 分,超越 Kimi K3 和 Qwen3.8 Max,成为当前最强开源模型。文章详细披露了从更大 Batch、更多任务到更大 Grader 算力三个维度扩展 RL 算力的技术细节,并在 3D 游戏、Blender、具身智能、材料设计及数学证明等高复杂度场景展示了应用潜力。适合关注大模型前沿技术方向的研究者与工程师,以及对强化学习、AI Agent 应用感兴趣的从业者阅读。原文 ↗

核心观点
  • MiMo-V2.6 系列的核心路径是通过可验证的复杂任务进行规模化强化学习(RL),让模型在持续反馈中自我学习,探索 RSI(递归自我改进)能力,而非仅仅依靠数据复制。
  • MiMo-V2.6-Pro 在 AA 综合智能指数中获得 46 分,超越 Kimi K3 和 Qwen3.8 Max,成为当前最强的开源模型。
  1. 01团队从三个维度扩展 RL 算力:更大的 Batch 与更高吞吐(单次更新 1568 样本)、覆盖 Code、Visual、Cyber 等更多任务类型、以及通过更大的 Grader 算力提供更精准的奖励信号。
  2. 02模型在材料设计领域展现出应用潜力,例如对 MOF 框架的筛选、以及高通量筛选 PFAS 污染物分子。
  3. 03模型能够在 Lean 中完成复杂数学定理的形式化证明。
  4. 04在 Design Arena 榜单上,MiMo-V2.6-Pro 的表现比肩 Claude 3。
  5. 05模型在 Computer Use Agent 任务中表现优异,能自主操作电脑并完成复杂 GUI 任务。
  6. 06团队提到该模型在具身智能任务中表现出色。
反方 / 局限
  • 文章主要描述了成功案例与性能提升,但未讨论规模化 RL 带来的计算成本是否经济可行,以及在非可验证任务(如主观创意写作)上的表现。
  • 文章未提及开源模型的许可证限制或后续维护社区策略,这是开发者评估是否采用时的关键因素。
3 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问