7.5
深览指数
科技微博·机器之心Pro··AI 生成
Action Map Policy: 高维动作回归到像素分类,新机器人操作学习范式
本文介绍了机器人操作学习的新范式 Action Map Policy (AMP),其核心创新在于将高维连续动作空间重新定义为像素级分类问题,从而统一视觉观测与动作表达于图像空间。作者首先指出现有方法(如 Diffusion Policy)在高维动作空间中面临组合爆炸难题,随后详细阐述了 AMP 如何通过将 3D 动作映射为多视角相机平面上的关键点像素轨迹,并利用交叉熵进行概率预测。文章通过抓取激光笔指定木块、以及咖啡制作、烤面包、蒸鸡蛋等复杂早餐任务的真实机器人实验,验证了 AMP 在细粒度感知、多模态动作表达、高精度(毫米级)闭环控制以及推理速度上显著优于 Diffusion Policy 和 ACT 等基线方法。本文适合对机器人操作学习、具身智能或模仿学习前沿范式感兴趣的研究者与实践者阅读。原文 ↗
核心观点
- ▍AMP 通过将 3D 机器人动作表示为多个相机视角下的 2D 关键点像素轨迹,将高维连续动作预测问题转化为图像空间上的像素级分类(交叉熵预测),这是一种新的机器人操作学习范式。
- ▍该范式借鉴了 LLM 的成功经验,统一了输入空间(图像)与输出空间(图像上的概率分布),天然具备描述多模态动作分布的能力,且单次推理即可输出完整动作概率分布,速度远快于迭代式的 Diffusion Policy。
- 01AMP 将 6-7自由度的高维动作通过可逆映射转化为 3D 关键点轨迹,再投影到多个相机平面形成二维像素轨迹,从而避免了传统离散化带来的动作组合空间爆炸(例如 10^6 量级)。
- 02在激光笔指物抓取任务中,仅用 40 条演示数据,AMP 达到了 100% 成功率;而 Diffusion Policy 出现了明显的模式坍塌问题,无法稳定抓取激光笔所指的木块。
- 03在三个早餐任务(制作咖啡、烤面包、蒸鸡蛋)的真实机器人实验中,AMP 的成功率比 Diffusion Policy 和 ACT 高出约 50%-70%,且在空间变化和精度要求高时性能稳定。
- 04AMP 的单次推理时间约为 13.80毫秒,而使用 16步 DDIM 去噪的 Diffusion Policy 需要约 93.53毫秒,使得 AMP 更适用于实时闭环控制。
- 05在 224×224 图像分辨率下,AMP 的 3D 动作重建精度可达约 1mm 的位置误差和 1.3° 的旋转误差,且精度与图像分辨率近似线性正相关。
- 06AMP 架构采用 X-Net 形状的 Encoder-Decoder 设计,包含多视角 Transformer 进行视角间信息交互,最终解码为多个时间步上的 heatmap 表示关键点在各像素位置的概率。
反方 / 局限
- — 文章未明确讨论其主要局限,例如对极端非结构化场景(如严重遮挡、大范围光照变化)的鲁棒性,以及在需要长距离精确空间推理的任务上的表现。
- — 将 3D 动作表达为 2D 关键点依赖于准确的相机内参和外参,如果相机标定存在误差或在实际部署中发生变化,可能会影响三角测量恢复 3D 轨迹的精度。
Action Map Policy (AMP)Haojie HuangDiffusion PolicyAction Chunking with Transformers (ACT)World Action Model (WAM)Southeastern University
11 分钟 · 5 卡片 · 8 资料
读原文 →