8.0
深览指数
科技人人都是产品经理·有新Newin··AI 生成
斯坦福团队将 LLM 后训练思路引入机器人,VLA 开始从真实经验中继续学
斯坦福博士生 Perry Dong 与导师 Chelsea Finn 提出面向机器人的通用后训练框架,核心观点是机器人基础模型已进入类似 GPT-2 的阶段——能力很强但可靠性不足,需要类似 LLM 的监督微调和 RLHF 来填补。作者分析了机器人强化学习面临的独特困境(数据昂贵、任务链长、奖励稀疏),并介绍其团队开发的 EXPO-FT 方法:通过轻量编辑策略小范围调整预训练模型动作,再让模型学回改进后的行为,在 6 个真机任务上平均仅用 19 分钟交互数据即达到 30/30 成功率。文章特别指出,机器人后训练缺的不仅是一个好算法,更是一整套从奖励定义到环境恢复再到人工干预的标准化流程。适合关注具身智能、机器人 RL、VLA 模型部署的读者。原文 ↗
核心观点
- ▍机器人基础模型已具备复杂任务能力,但可靠性不足(95% 成功率仍有 5% 故障),需要类似 LLM 后训练(监督微调、RLHF、基于可验证奖励的强化学习)的通用流程来弥合从 Demo 到部署的差距。
- ▍现有的机器人强化学习方法(PPO、SAC 等)不适用于当前 VLA 模型,原因有二:现代模型使用 Diffusion 等生成方式表达多样化动作,而非正态分布;十亿参数规模下价值学习的误差积累不可控。
- 01EXPO-FT 的核心思路:基础模型生成候选动作,轻量编辑策略做有限幅度调整,价值函数筛选最优执行;成功动作再回传训练基础模型,实现“先小改,再学回去”。
- 02在 6 个复杂操作任务中(穿灯串、击台球、插花、翻鸡蛋等),EXPO-FT 平均使用约 19 分钟真实机器人交互数据即达到 30 次测试全部成功,对比方法均未达标。
- 03机器人强化学习与语言模型有三点不同:数据生成昂贵(单次尝试占用真实设备,无法并行采样)、任务链长(数百至数千个控制步骤)、奖励稀疏(只在任务结束才出现),因此更加依赖价值函数进行信用分配。
- 04LLM 后训练的成熟来自一套标准化方法:强预训练模型 + 明确的奖励定义 + 成熟 RL 算法 + 对奖励作弊等常见问题的应急方案。机器人领域目前仍处于“手艺”阶段,依赖研究者个人经验。
- 05EXPO-FT 通过限幅编辑策略降低 RL 对大模型的直接冲击,使训练更稳定;但任务长度增加后,价值函数对长期信用分配的准确性仍是核心瓶颈。
反方 / 局限
- — EXPO-FT 仍依赖大量人工参与,包括定义任务成功标准、恢复场景、即将出错时干预;扩大到机器人集群后,人工效率是 Scaling 的关键瓶颈。
- — 19 分钟指的是真实机器人交互时间,不包括模型计算的梯度更新时间;后者目前仍是大规模后训练的主要时间瓶颈。
- — 机器人领域缺乏通用的成功检测器和奖励函数定义方法,目前要么每任务单独开发,要么依赖人工观察,远未像 LLM(代码运行测试、数学答案检查)那样有默认方案。
Perry DongChelsea FinnDorsa SadighGoogle DeepMindPhysical Intelligence斯坦福大学EXPO-FTVLAWAMDiffusion PolicyRLHFPPOSAC强化学习价值函数后训练模仿学习
15 分钟 · 5 卡片 · 14 资料
读原文 →