7.6
深览指数
科技量子位··AI 生成

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

星动纪元发布的世界动作模型VPP2在RoboDojo仿真榜单综合排名第一,领先GPT-6-Astra等模型,并在泛化、精细操作、记忆三个细分维度拔得头筹。本文详解了VPP2通过“视频预测与动作学习分阶段训练”的技术路线,实现了预测泛化与行动泛化的双突破,并探讨了“GPT负责想、VPP2负责做”的新范式。适合关注具身智能、机器人技术路线及AI工程化落地的读者,读完能快速理解当前世界动作模型(WAM)领域的关键竞争点与下一代技术演进方向。原文 ↗

核心观点
  • ▍VPP2的核心突破在于通过“解耦”视频预测与动作学习并分阶段训练,实现了预测泛化到行动泛化的双重提升,不依赖外挂增强或额外数据刷分,证明了优化数据管线和训练范式仍有巨大价值。
  • ▍具身智能下一阶段范式将是“GPT+VPP2”的组合:GPT等通用认知模型负责高层规划与任务拆解,VPP2等世界动作模型负责低层物理预测与动作生成,形成完整的物理AI闭环。
  1. 01在RoboDojo仿真榜单上,VPP2综合平均成功率32.26%,平均得分39.26分,两个指标双双第一;作为对比,GPT-6-Astra的成功率为22.48%,得分28.97分。
  2. 02VPP2在真实ALOHA双臂机器人上的零样本操作测试中平均成功率为58.5%,高于π0.5的40%,并在10类任务中拿下9类最佳。
  3. 03VPP2采用三阶段训练策略:事件级视频继续预训练、固定时长视频后训练与蒸馏、动作专家训练。核心是先将视频预测能力练到足够强,再将其转化为动作,同时通过冻结视频模型参数(仅LoRA适配)保住泛化能力。
  4. 04VPP2以阿里开源的Wan2.1-I2V-14B为基础,通过将操作过程切分成语义完整的片段并配以详细描述,在14B参数下达到了90%的指令遵循率,超越64B参数的Cosmos3模型的78%。
  5. 05在LIBERO-Pro和LIBERO-OOD泛化测试中,VPP2总体成功率分别达到45.0%和63.9%,而其他基线模型在LIBERO-Pro最高仅11.0%。
  6. 06引入VLM高层规划器后,VPP2在RoboDojo长程任务中的平均成功率从27.6%提升至57.6%,验证了“认知+执行”协同的可行性。
反方 / 局限
  • — 文章承认RoboDojo仍然是仿真环境,现实世界中物体的摩擦、形变、位置偏差会陡生变数,VPP2的泛化能力是否能在更复杂的真实长期场景中稳定运行,还需进一步验证。
  • — 尽管已有物流业务(中国邮政、顺丰等)的常态化运营,但文章并未给出VPP2规模化部署的具体商业指标或成本数据,其商业化进展是否具备可复制性仍存疑。
17 分钟 · 5 卡片 · 12 资料
读原文 →

前置背景

技术原理

商业模式

平行视角

延伸追问