7.6
深览指数
科技腾讯新闻·夕小瑶科技说··AI 生成

小米直播大模型训练,两天烧掉800万

小米MiMo大模型团队首次公开直播强化学习训练过程,展示了惊人的账本:Pro和Flash两条训练线两天合计花费超113万美元(约800万人民币)。文章核心信息包括:训练以代码任务为主占三分之二,通过率每提高1个百分点Pro需14万美元、Flash需3.8万美元;Pro训练到第10步得分追平DeepSeek-V4-Pro。这是国内首次公开强化学习阶段的数据配比和实时成本,行业首例。适合关注大模型训练成本、工程效率细节的AI从业者或投资者阅读。原文 ↗

核心观点
  • 小米首次直播大模型强化学习训练,透明公开了实时成本、数据配比和故障日志,这是一个行业首创的操作,核心目标是验证强化学习能扩展到多远。
  • 烧钱速度惊人:两条训练线两天共花费超113万美元,超过DeepSeek-R1(29.4万美元)和MiniMax-M1(53.5万美元)两家之和。
  1. 01训练以代码任务为主,代码占数据集的2/3,一道题平均55轮工具调用、9万token上下文,一步要做2.5万道题,这是成本高昂的核心原因。
  2. 02Pro线训练通过率每提高1个百分点大约需14万美元,Flash线约3.8万美元;Pro第11步通过率61.4%比第一步提升4.9个百分点。
  3. 03Pro训练到第10步得分63.72,追平DeepSeek-V4-Pro;Flash第12步得60.77。离榜首Claude Fable 5差7分。
  4. 04仪表盘公开了训练故障日志,如「Pro训练因一个节点的显存问题正在重启」,展现了真实的工程运维过程。
  5. 05Pro每一步开销含模型答题(58分钟)+更新参数(64分钟),合计约2小时06分,每步约7.4万美元。
  6. 06小米今年在大模型上已连出四波动作:3月匿名模型Hunter Alpha登顶调用榜、4月V2.5系列开源(1T参数/42B激活)、6月UltraSpeed版本+ MOPD论文。
反方 / 局限
  • 文章暗示了关键局限:训练成本已远超同行,但仅用DeepSWE一个评测数据集(矛式任务),结论能否泛化到通用任务尚不明确。
  • 数据透露通过率增长已在放缓(Pro前10步平均一步0.5个百分点),但模型尚未收敛,后续继续扩展的边际成本可能持续走高。
8 分钟 · 3 卡片 · 7 资料
读原文 →

前置背景

平行视角

延伸追问