7.1
深览指数
科技微博·量子位··AI 生成

看了20万小时「人类干活实录」,机器人悟了

本文报道了昆仑万维旗下子公司黎曼动力的机器人模型 Riemann-1.0,该模型在 RoboCasa-365 家务排行榜上以 62.6% 成功率登顶,大幅超越此前最佳水平。其核心突破在于,利用 20 万小时人类第一视角视频作为预训练数据,并通过自研流水线将无标注视频转化为机器人可执行的动作控制信号,最终在仿真和真机测试中均展现出领先的泛化能力。文章清晰梳理了具身智能领域“VLA 与世界模型”路线合流的技术趋势,并解释了昆仑万维从内容赛道切入机器人赛道的战略逻辑。适合对具身智能、机器人技术路线及产业落地感兴趣的读者阅读。原文 ↗

核心观点
  • 机器人领域下一阶段的基础模型范式,是利用海量人类第一视角视频进行预训练,以学习物理世界交互的“直觉”,再辅以少量机器人数据进行动作对齐,从而极大提升泛化能力和任务成功率。
  1. 01Riemann-1.0 在 RoboCasa-365 上以 62.6% 成功率登顶,比之前的最佳成绩(SOTA)高出 8.4 个百分点,该榜单上大部分模型成功率低于 50%。
  2. 02Riemann-1.0 的训练数据包含 23.2 万小时,其中 20 万小时为人类第一视角视频,1.2 万小时为 UMI 与外骨骼手套数据,2 万小时为机器人真机与仿真轨迹。
  3. 03消融实验显示,在 RoboCasa-365 上,仅使用机器人数据预训练成功率为 43.4%,加入人类视频数据后,成功率猛增至 62.6%,提升了 14.4 个百分点,增益远超其他类型数据。
  4. 04在 EgoVLA 基准测试中,加入人类视频预训练后,长程多阶段任务成功率从 42.96% 提升至 71.11%,在完全陌生的视觉背景下成功率从 26.36% 提升至 43.33%。
  5. 05Riemann-1.0 在真机测试中,平均成功率为 85.00%,过程完成度为 94.43%,在四类家务任务(积木堆叠、布料折叠、桌面整理、厨房收纳)中均表现领先。
  6. 06Riemann-1.0 的架构采用全因果动作-视频联合建模框架,并设计了本体专属的动作映射模块,可适配 41 种不同形态的机器人本体。
  7. 07训练策略分为三阶段,动作损失权重从 0.1 逐步递增至 0.9,实现了从“理解世界”到“执行动作”的渐进式切换。
反方 / 局限
  • 文章虽强调人类视频数据的巨大价值,但处理该数据需要自研的复杂自动化流水线(包括畸变矫正、VLM 切分、手部 3D 重建、多项质检与分类),技术门槛高,并非所有团队都能轻易复现。
  • 文章主要聚焦于 Riemann-1.0 在操作任务上的成果,但对模型的推理速度、计算成本、以及在更复杂、非结构化的物理环境中的鲁棒性讨论不足。
11 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问