7.6
深览指数
科技量子位·一水··AI 生成
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
小米通过6天350万美元(约2344万人民币)公开直播,完成了MiMo-V2.6 Pro和Flash两版模型的大规模强化学习训练。Pro模型(1.02万亿参数,420亿激活)在AI Index上以46分登顶开源第一,部分Agent评测逼近GPT-5.6 Sol和Claude Opus 5。文章核心价值在于公开了详实的大规模RL训练工程实践,包括Reward Hacking对抗、Router冻结、组内评分等创新方案,并展示了模型在新材料设计、3D建模等跨模态场景的泛化能力。适合关注前沿大模型训练技术、RL Scaling工程挑战、开源模型竞争力的深度读者阅读。原文 ↗
核心观点
- ▍MiMo-V2.6通过公开直播完成了迄今开源模型最大规模的单次强化学习训练,证明RL Scaling在工业级规模下可以持续推动模型能力提升,且能解决训练中涌现的Reward Hacking、MoE专家坍缩等结构性问题。
- 01MiMo-V2.6-Pro(1.02万亿参数,420亿激活)在Artificial Analysis Intelligence Index上以46分位列开源第一,部分Agent评测(如AutomationBench)得分超过Claude Opus 5和GPT-5.6 Sol。
- 02Pro版本完成30个Step花费约260万美元,耗用约81B-111B训练Token;Flash版本花费约90万美元。30个Step后Flash平均通过率相对提升25%,Pro提升12%。
- 03样本外测试DeepSWE v1.1显示,Pro从58.4分涨至72.57分,Flash从48.7分涨至65.68分,证明RL训练的能力迁移至未见的软件工程任务。
- 04在Pro的训练成本中,训练模型占43.5%,生成Rollout占43.8%,评分器Grader占12.7%(约33万美元)。小米设计了两套组内评分机制,按实现质量和解决过程给通过测试的方案区分奖励,防止投机。
- 05为对抗模型的Reward Hacking,团队清理训练环境并派出Hack Agent主动攻击环境寻找漏洞,最终Pro和Flash的Reward Hacking轨迹比例均控制在2%以下。
- 06RL过程中MoE Router发生漂移,导致专家负载峰值从6倍涨至16倍,冷专家比例从0.5%升至22%。小米最终通过冻结Router参数解决,模型能力未下降。
- 07MiMo-V2.6-Pro在同等智能水平下完成任务的平均成本仅为国际前沿模型的1/20至1/60,AAI任务单次成本约0.13美元,仅为同分闭源模型Grok 4.7(3.74美元)的约1/29。
- 08小米将Pro和Flash模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架全部开源。
- 09MiMo-V2.6在新材料设计(MOF抓PFAS)场景中,模拟结果显示候选结构吸附性能是对照材料的百万到千万倍,被北大研究员评价为相当于训练有素的博士研究员。
反方 / 局限
- — RL训练成本高昂,Pro版单次30步训练花费260万美元,且Grader成本占12.7%,规模化部署的经济可行性需要持续验证。
- — 尽管在多项评测中达到开源第一,但文中引用的部分评测(如MOF材料设计)由小米内部团队完成,缺乏独立第三方复现验证。
MiMo-V2.6MiMo-V2.6-ProMiMo-V2.6-Flash小米Hugging FaceDeepSeek-R1罗福莉Nathan LambertElie Bakouch窦金虎Artificial Analysis Intelligence IndexDeepSWE v1.1AutomationBenchMOFPFAS
24 分钟 · 3 卡片 · 7 资料
读原文 →