7.2
深览指数
科技腾讯新闻··AI 生成

1小时30000美元,罗福莉直播“烧钱”

小米MiMo大模型负责人罗福莉公开了MiMo-V2.6训练过程的实时看板,每小时训练成本约3万美元。文章梳理了她从推理优化到智能体框架的演进思路,并分析训练成本不仅来自参数更新,还包括工具执行、环境验证等大量工程开销。适合关注大模型训练效率、成本结构与技术路线的从业者和研究者阅读。原文 ↗

核心观点
  • 小米MiMo技术路线定位为面向智能体任务建设基础模型,同时优化模型架构、训练系统和运行框架,让能力提升具备可承担的成本。
  1. 012025年12月至2026年9月,罗福莉的思路是从提高推理和后训练效率,到改进模型执行任务的框架(Harness),再到扩大多任务强化学习。
  2. 02训练看板显示每步约20亿Token,配置为1568个提示、每个提示16次尝试,一批包含25088条尝试轨迹,采用全异步方式。
  3. 03训练成本每小时约3.08万美元,两轮训练累计展示费用约115万美元,但未包含硬件折旧、能源、人力等完整研发成本。
  4. 04Flash模型在DeepSWE v1.1评测中从第1步48.67升至第12步60.77;Pro从第1步58.41升至第10步63.72,但中间有明显波动和回落。
  5. 05训练过程中出现过因节点显存问题导致的重启,反映训练效率取决于算法和系统稳定性。
  6. 06罗福莉分析低价值工具调用和反复携带长上下文会推高成本,主张让更节省Token的Harness与更强、更高效的模型共同演进。
  7. 07MiMo Code最初由5人用14天完成开发并开源,体现团队在小团队协作下的效率。
反方 / 局限
  • 公开看板数据还不足以解释每一步成绩变化的原因,任务构成、难度和基础设施故障都可能影响平均通过率,截取单条上涨曲线可能误导判断。
  • 每小时3万美元的费用仅反映训练阶段的部分投入,最终商业价值需待模型上线后,根据任务完成质量和用户实际成本检验。
8 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问