7.4
深览指数
科技腾讯新闻·量子位··AI 生成

罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元

小米MiMo团队负责人罗福莉公开了新一代模型MiMo-V2.6的强化学习训练过程,并采用在线直播形式实时展示训练进度、成本(平均每小时3万美元)与奖励曲线。文章核心阐述了小米在Agentic RL scaling上的三个方向:扩展训练计算量(20亿Token/step、异步流水线)、扩展任务环境与执行框架(多任务混合)、以及扩展评分计算量(精细化信用分配)。适合关注大模型前沿训练技术、尤其是RL scaling路线的研究者与从业者阅读。原文 ↗

核心观点
  • 小米MiMo团队认为,强化学习也可以像预训练一样实现scaling,沿三个维度扩展即可持续提升模型能力:训练计算量、环境/执行框架、评分计算量。
  1. 01MiMo-V2.6训练采用直播形式,实时公开训练进度、成本与奖励曲线,从pro模型开始36小时已花费超108万美元,平均每小时3万美元。
  2. 02MiMo-V2.6每个训练Step约处理20亿Token,配置为1568个Prompt × 每个Prompt 16条Rollout(即2.5万条轨迹)。采用完全异步(Fully Async)执行方式,不同任务可同时处于生成、执行、评分、训练不同阶段。
  3. 03第二扩展方向为环境与执行框架的scaling:MiMo-V2.6支持代码、通用任务、视觉、Chat等多任务混合训练,不同任务运行在不同Harness(执行框架)中。
  4. 04第三扩展方向为评分计算量scaling:通过Agentic In-group Credit Assignment方法,利用同组多条Agent轨迹,获得比简单成功/失败更细致的强化学习信号。
  5. 05Pro模型dynsam/avg@n从第1步约0.565提升至0.614;Flash从约0.514提升至0.603。DeepSWE v1.1离线评测中Pro和Flash分别达到62.24和60.77(对比DeepSeek-Flash v1.1为74.2)。
8 分钟 · 5 卡片 · 13 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问