7.4
深览指数
科技微博·量子位··AI 生成

2000+真实场景搬进仿真!一个导航模型零样本“通吃”四种机器人本体

亮源新创在具身智能领域提出“三段范式”(规模化预训练、对齐、部署),并发布LightParkour、LightNav-0和Light REACT三项技术。核心论点在于:机器人的能力不应停留在“会做什么”,而应转向能否在环境、任务、本体甚至自身状态变化下持续规模化扩展。文章详细介绍了三项技术如何围绕一个学习闭环构建:从单一动作样本扩展为技能分布,从2000+互联网场景转化导航经验,以及通过全身上下文学习实现硬件损伤后的韧性运动。适合关注具身智能技术路线和基础模型规模化策略的读者。原文 ↗

核心观点
  • 具身智能的下阶段核心问题不是增加孤立技能,而是建立一套能让能力持续规模化扩展的学习机制,即亮源新创提出的“三段范式”:规模化预训练、规模化对齐和规模化部署。
  • 三段范式形成闭环的关键在于真实世界数据持续回流:部署产生的成功、失败、异常数据成为下一轮预训练和对齐的输入,推动模型持续迭代。
  1. 01LightParkour从一段针对45厘米障碍物的人类动作出发,通过物理仿真和课程学习,自动生成覆盖至75厘米障碍(约机器人身高83%)的参考轨迹,将单个动作样本扩展为一个技能分布。
  2. 02LightNav-0通过Real2Sim2Real引擎将2000+个互联网场景转化为仿真环境,生成4000+小时训练经验,并发现扩大环境覆盖度比单纯增加同环境轨迹数量更能提升泛化能力。
  3. 03LightNav-0引入Point CoT机制,将任务推理从“视觉+语言直接生成动作”变为“视觉语言理解→空间推理→动作生成”,在8项消融评测中平均任务成功率提高8.4个百分点。
  4. 04Light REACT使用全身上下文学习(Whole-Body In-Context Learning),在部署时不提供故障标签,仅依赖机器人自身的交互历史(64帧因果上下文窗口)推断当前身体状态并调整运动策略。
  5. 05Light REACT通过偏好强化学习(Preference RL)对齐行为偏好后,直立行为比例从约42%提高到约76%,爬行行为从约45%下降至约16%。
  6. 06LightNav-0最终实现将一个模型零样本迁移到人形、四足、轮式和飞行四种不同机器人本体,并在10个仿真设置中覆盖指令跟随、目标导航和具身视觉跟踪等任务。
反方 / 局限
  • 文章承认Light REACT的上下文学习能力局限于训练所覆盖的损伤分布内,并非泛化到任意未见过故障类型,这与S1和GEN-1.5利用上下文学习新任务的能力有本质区别。
  • Physical AI的Scaling方向是否有别于大语言模型尚未定论——机器人不仅需要更多数据,更需要在更多样化环境中积累经验,这意味着数据策略可能截然不同。
18 分钟 · 4 卡片 · 9 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问