7.9
深览指数
科技量子位·思邈··AI 生成
刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降
本文梳理了2026年机器人预训练领域的三大路线:Figure通过自建人类数据供应链Index,将未预训练模型9%的成功率提升至56%;Dyna用百万小时人类视频验证了预训练规模可延伸至真机闭环表现;亮源新创Light-O1基于互联网第三视角视频,首次验证了1200亿tokens人类动作预训练对多本体人形机器人的迁移缩放定律。文章的核心贡献在于分层澄清了“规模效应”的不同层级——从离线迁移到闭环表现,并指出真正的竞争在于整条数据成本链(采集、表示、对齐、算力、真机经验),而非单纯比较视频小时数。适合关注机器人规模化部署策略和AI数据经济性的科技从业者与研究者阅读。原文 ↗
核心观点
- ▍2026年机器人预训练的核心问题已从“人类数据有无用”,转向“人类经验能否像文本之于大模型那样,成为可扩展、可预测下游收益的数据来源”,而不同路线的竞争在于整条数据成本链,而非单纯的视频小时数。
- ▍需要警惕“规模效应”的层级混淆:预训练规模扩大改善离线指标,不等于能线性转化为闭环真机表现;Figure(闭环9%至56%)和Dyna(闭环20%至53%)与亮源新创(离线迁移)的实验处在不同层级,不能直接横向对比。
- 01Figure Helix 2.5在30个陌生家庭中,经Index预训练的模型完整任务成功率为56%,而未预训练模型仅为9%,主要差异在于是否经过Index预训练。
- 02Figure用四档嵌套Index数据(跨度8倍)离线评测发现,预训练数据规模每翻倍,机器人动作预测验证损失规律下降,预测误差仅为整个数据范围损失变化的0.54%。
- 03Dyna Robotics使用1000小时至100万小时四档第一视角人类视频预训练,在14个真机任务上的平均归一化得分依次为20%、28%、45%、53%,证明预训练规模差异可延伸至闭环表现。
- 04Dyna的消融实验显示,单纯扩大人类数据会导致过拟合;只有加入不带动作标签、仅供视频预测的人类视频后,跨本体表现才呈现稳定单调提升。
- 05亮源新创Light-O1将人类动作预训练规模从37.5亿扩展至1200亿tokens(约10万小时),在第一视角人类数据、Unitree G1机器人和自研机器人目标域上,动作预测误差、全身姿态误差、腕部位置误差均呈幂律下降,称为“迁移缩放定律”。
- 06Figure Index平台到8月底已收到超1600万条视频,向创作者累计支付1500万美元,新数据以约35分钟/秒的速度流入,并通过质量过滤、反作弊、去重、再平衡和文本标注治理。
- 07Figure与Nscale达成初始35亿美元算力合作,未来或扩大至60亿美元以上,计划基于英伟达Vera Rubin部署最高10万颗GPU。
反方 / 局限
- — Figure目前未公布1倍、2倍、4倍、8倍Index预训练分别对应的真实机器人完整任务成功率,因此不能推导出“预训练规模扩大后,闭环成功率按相同规律连续提升”。
- — 亮源新创Light-O1目前公开的主要是适配后的离线迁移指标,尚未验证在真实机器人闭环中的表现,其“迁移缩放定律”到闭环的延伸仍缺乏证据。
- — Figure Helix 2.5声称使用约一半任务专属数据达到此前相近成功率,但该比较跨了模型代际和评估条件,并非严格控制的等性能实验,不能得出“Index普遍将机器人数据需求减半”的结论。
17 分钟 · 4 卡片 · 9 资料
读原文 →