7.0
深览指数
科技腾讯新闻·字母AI··AI 生成
罗福莉压力有多大?都给小米模型训练整上直播了
小米大模型负责人罗福莉公开了MiMo-V2.6模型的训练过程,直播显示不到两天已花费超130万美元。文章详细拆解了训练中的强化学习规模扩展、Agent任务设计、算力成本等细节,并分析了罗福莉近半年的工作重点。对小米三年600亿AI投入的落地前景、模型与产品的协同挑战做了延伸讨论。适合关注大模型训练成本、强化学习工程化、国产大模型竞争策略的深度读者。原文 ↗
核心观点
- ▍罗福莉团队近半年的核心工作是研究强化学习能在Agent训练中扩展到什么程度,包括增加任务尝试次数、扩充训练环境、投入更多评分算力。
- ▍小米公开训练过程(含实时成本、错误日志)是一种具冲击力的技术公关,但MiMo模型在大厂竞争中能否形成差异化和规模效应,仍面临巨大不确定性。
- 01MiMo-V2.6 Pro训练44小时花费约93万美元,Flash训练40小时花费约41.6万美元,合计成本已超134万美元。
- 02训练数据配置:每个步骤1568条提示词,每条16次尝试,合计25088条轨迹,涉及约20亿token。
- 03DeepSWE v1.1编码测试中,Pro通过率65.78%,Flash通过率60.77%,编程类提示词占比67.7%。
- 04训练过程中出现计算节点显存问题和基础设施错误,导致从第15步重启,故障已直播公开。
- 05雷军宣布未来三年在AI领域至少投入600亿元,MiMo团队提供基础模型能力,产品端有小爱同学、手机、汽车等团队衔接。
- 06小米AI编程助手MiMo Code已于2024年7月26日结束免费期,改为订阅收费。
反方 / 局限
- — 文章暗示但未明确讨论的反方:编程测试的高通过率未必能直接迁移到手机、汽车、智能家居等复杂真实场景,产品端遇到的实际问题会更多。
- — 同一赛道竞争激烈:DeepSeek V4.1-Flash已于9月10日发布,同样强调扩大强化学习规模,并且已面向开发者使用。小米的方案差异化和工程化能力尚未被验证。
12 分钟 · 4 卡片 · 12 资料
读原文 →