6.9
深览指数
科技智东西·茄子··AI 生成

李飞飞出手!用世界模型训练机器人,五种真机跑一小时不出错

World Labs 发布了 R2S2R(真实-仿真-真机)闭环引擎,通过世界模型将真实机器人任务重建为高保真仿真环境,并实现在该环境中训练、评估策略,再迁移至真机执行。关键成果是:在 5 种不同机器人平台上,纯仿真训练的策略在真实环境中运行一小时不出错,且仿真能准确预测现实中的策略失败边界。本文核心贡献在于展示了虚实对齐的仿真环境作为机器人规模化训练基础设施的可行性,而非单一技术突破。适合关注机器人基础模型、具身智能 Scaling Law 的技术从业者和研究者阅读。原文 ↗

核心观点
  • 通过世界模型构建虚实高度对齐的仿真环境(R2S2R 引擎),可以替代大量真实机器人训练和评估,是释放机器人领域 Scaling Law 的关键路径。
  • 在仿真环境中表现更好的策略,在真实硬件测试中同样表现更优,仿真能保持不同策略间的相对排名并预测失败边界,具备替代部分真机测试的能力。
  1. 01R2S2R 引擎将训练过程分为 Real-to-Sim(真实转仿真)和 Sim-to-Real(仿真转真机)两个阶段。Real-to-Sim 阶段采集机器人本体、传感器、环境、物体和交互数据,重建为可交互的虚拟世界。
  2. 02在 5 种不同机器人平台(ALOHA、YAM、RB-Y1、Flexiv、xArm)上完成测试,覆盖刚性物体、关节结构物体、可变形物体(线缆、箱体)等多种交互对象,纯仿真训练的策略在真机上一小时不出错。
  3. 03以 ALOHA 双臂立方体交接任务为例,在仿真与真实环境中的临界成功测试中,两种环境均复现了相同的接近失败行为并获得一致的任务结果;失败测试同样能还原对应的失败行为和结果。
  4. 04实验覆盖不同策略架构、训练配置,以及训练集内(ID)和训练集外未知位置(OOD)两类场景,结果显示仿真能保持不同策略之间的相对排名,并呈现与真实环境相似的成功/失败区域分布。
  5. 05R2S2R 引擎还可用于在数千种可控仿真条件下主动搜索模型失效场景,在真实测试前筛掉大量检查点,只把最有潜力的策略投入高成本硬件测试。
  6. 06World Labs 由李飞飞创立,于 2026 年 7 月 21 日收购了美国机器人仿真创企 SceniX,此项成果由双方联合打造。
反方 / 局限
  • 文章承认仿真系统并不需要完全复现真实世界中的成功率,而是需要支持与现实世界一致的决策逻辑——即仿真能识别策略成功/失败的位置、判断优劣、预测改进是否可迁移。这意味着仿真与真实之间仍存在绝对成功率的差距,并非完全等价。
  • 文章未提及仿真环境构建本身的成本(如采集真实数据、重建高保真仿真所需的算力和时间),也未讨论对于极度复杂、高自由度场景(如多机器人协同、非结构化户外环境)的可行性。
  • 目前展示的案例均为受限的实验室环境或特定工业场景(装箱、布线、分拣),距离通用机器人所需的开放世界泛化能力仍有显著差距。
15 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问