7.8
深览指数
科技Bestblogs·腾讯科技··AI 生成
Figure 租了 30 套房,让机器人挨家“考核家务”
Figure 公司发布 Helix 2.5 神经网络,在 30 套未采集数据的陌生住宅中,让人形机器人零样本完成整理客厅、铺床、折毛巾等长时程家务任务,端到端成功率从 9% 跃升至 56%。实验关键变量是人机行为预训练数据 Index 的加入,这也是首次在人形机器人上验证「人类到机器人迁移缩放定律」——大众对家用机器人「终于能干活」的判断与作者强调的「零样本边界与数据复用逻辑」之间存在张力,后者对从业者更有参考价值。适合关注具身智能技术路线与机器人商业化落地的读者。原文 ↗
核心观点
- ▍Figure 通过引入人类行为预训练数据 Index,首次在人形机器人上让零样本家务成功率从 9% 提升至 56%,并验证了人类到机器人迁移遵循可预测的缩放定律。
- 01Figure 租下旧金山湾区 30 套住宅,让 Figure 03 机器人连续完成整理客厅、铺床、折毛巾三项长时程全身任务,评估标准要求端到端完全成功,出现一次人类安全干预即判失败。
- 02控制实验显示,两个模型架构、优化方式、超参数、下游数据与评估方法完全一致,唯一差异是是否经过 Index 预训练;无预训练基线成功率 9%,加入 Index 后达 56%。
- 03没有任何单一评估任务占 Index 预训练数据比例超过 1.90%,说明能力提升来自广泛人类行为的可迁移学习,而非数据泄露。
- 04与 Helix 02 相比,Helix 2.5 达到相当成功率只需一半适应数据,并将行为泛化到 30 套未见住宅,行为指定成本降低 2 倍、部署范围扩大 30 倍。
- 05团队在 Index 嵌套子集上训练四个模型,预训练数据规模最大跨度 8 倍,结果显示 Index 数据量每翻倍,下游动作预测 loss 平滑且可预测地下降;小规模实验可预测最大规模训练后的测试损失,误差仅占完整变化范围的 0.54%。
反方 / 局限
- — 文章澄清「零样本」有明确边界:任务行为本身经过其他环境的数据适配,真正验证的是跨环境与跨物体的泛化能力,而非完全没有任务训练。
- — Figure 强调这并不意味着通用人形机器人问题已被解决,目前仅在家务长时程任务上取得进展,距离真正商用仍有距离。
4 分钟 · 3 卡片 · 9 资料
读原文 →