8.2
深览指数
科技微博·量子位··AI 生成
刷网络视频也能教会机器人干活!1200亿tokens人类动作预训练
文章系统梳理了2026年机器人预训练领域的关键进展,核心结论是:大规模人类行为数据(无论是第一人称视频还是互联网视频)预训练,能显著提升机器人在陌生环境中的任务表现,并呈现出可预测的规模效应。作者通过对比Figure、Dyna、亮源新创三家公司的技术路线和实验证据,指出“预训练规模效应”存在不同层级(离线指标、跨本体迁移、闭环真机表现),且不同路线各有其成本结构和待验证环节。适合对机器人技术前沿和AI数据策略有了解需求的读者,尤其是关注技术路线选择判断而非单纯资讯积累的人。原文 ↗
核心观点
- ▍大规模人类行为数据(人类视频或人类动作)预训练,能使机器人在陌生环境中的闭环任务表现大幅提升,并呈现出可预测的规模效应,但不同技术路线和评估层级(离线/闭环节点)的规模效应不能直接等同。
- 01Figure的Helix 2.5在30个陌生家庭中测试,经Index(人类动作)预训练的模型完整任务成功率为56%,而随机初始化的模型仅为9%。
- 02Figure通过四档嵌套的Index数据规模实验(总跨度8倍),观察到下游机器人动作预测损失随预训练数据规模扩大呈规律性下降。
- 03Dyna Robotics使用1000小时至100万小时四档人类视频预训练,在14个真实机器人任务上平均归一化得分从20%提升至53%,证明预训练规模差异在闭环真机表现中持续存在。
- 04亮源新创(Light Origins)将人类动作预训练规模从37.5亿tokens扩展到1200亿tokens(约10万小时人类动作),在第一视角人类数据、Unitree G1机器人及自研人形机器人等目标域上,动作预测误差持续下降并呈幂律趋势,即“迁移缩放定律”。
- 05Figure搭建了Index创作者网络,至8月底已收到超过1600万条视频,累计支付1500万美元,数据以约35分钟/秒的速度流入,并配套去重、反作弊、再平衡等数据治理流程。
- 06Dyna的消融实验表明:仅用动作预测会导致过拟合;加入未来视频预测后迁移表现改善;进一步加入无动作标签的人类视频后,规模效应才呈现稳定单调提升。
- 07亮源新创的Light-O1从互联网第三视角视频中恢复结构化人类动作,编码为统一的人形动作表示,与视觉、语言信息一起进行自回归预训练,得到人类动作先验。
反方 / 局限
- — Figure公开的四档Index数据规模效应实验仅基于离线动作预测损失,并未同时公布对应各档规模的真实闭环成功率曲线,因此无法直接推导“预训练规模翻倍→闭环成功率连续提升”的结论。
- — Figure的Helix 2.5在单任务上相比前代用更少任务专属数据达到相近水平,但该比较涉及模型代际和评估条件变化,不能直接量化“Index预训练普遍减少多少机器人数据需求”。
- — 从互联网视频提取可迁移经验的路线的成本不在数据采集,而在视频清洗、动作恢复精度、领域差距弥合以及所需的大量训练算力,其整体经济性尚未在与Figure路线的直接对比中得到验证。
Figure Helix 2.5Dyna Robotics亮源新创 (Light Origins)Brett AdcockNscaleIndex (Figure的数据平台)人形机器人规模定律迁移缩放定律 (Transfer Scaling Law)CoMoHuRoRhodaLight-O1英伟达Vera Rubin
15 分钟 · 4 卡片 · 12 资料
读原文 →