5.7
深览指数
科技微博·量子位··AI 生成
冲刺全球首个100万小时具身数据!三家国产公司,联手了
黎曼动力联合光轮智能、诺亦腾机器人,宣布将共建具身智能数据底座,目标在2026年底完成100万小时机器人训练数据采集,达到当前全球高质量具身交互数据存量(约50万小时)的两倍。文章认为,具身智能的Scaling关键卡在数据,而散落在不同玩家手中的数据无法形成闭环。三家公司分别扮演模型训练、仿真基建和动捕数据采集的角色,试图构建一条数据闭环,加速验证机器人能力能否随数据量增长而Scaling。适合关注具身智能、机器人产业和数据基础设施的读者。原文 ↗
核心观点
- ▍具身智能的Scaling卡在数据层面,数据量不够且分散,缺乏从采集到训练的闭环,而黎曼动力联合光轮智能、诺亦腾机器人,试图通过构建数据闭环来突破这一瓶颈。
- 01亿欧智库报告估算,当前全球高质量具身交互数据仅约50万小时;黎曼动力目标是在2026年底完成100万小时,是现存量的两倍。
- 02黎曼动力已用23.2万小时数据训练出Riemann-1.0模型,初步验证了其技术路线。
- 03当前行业数据规模有限:Physical Intelligence的π0使用超过1万小时数据,英伟达GR00T 1.7约4万小时,谷歌DeepMind联合20多家机构才凑出100多万条轨迹。
- 04文中将机器人数据分为三类:真机数据(精准控制)、人类视频(语义理解)、仿真数据(长尾场景),并指出三者各有短板且分散在不同玩家手中。
- 05黎曼动力前身是昆仑万维的Matrix世界模型团队,从游戏世界模型转向机器人世界模型,底层技术相通。
- 06类比自动驾驶行业,Waymo通过自建真实道路、仿真和评测的闭环,推动数据迭代,但机器人行业因缺乏数据入口、硬件损耗高等原因,难以照搬,联合建设更现实。
- 07英伟达已联合Google DeepMind、迪士尼及多家云厂商、机器人公司,共建Physical AI Data Factory,验证了联合构建数据基础设施的路径。
反方 / 局限
- — 文章未主动讨论反方或局限,但可推断:100万小时数据是否足以触发Scaling,尚无实证;公司联合体内部利益分配、数据标准统一、模型训练效果验证等,均存在不确定性。
- — 类比自动驾驶时,Waymo的闭环是自建且高度垂直的,而黎曼动力等三家公司是松散联合,其数据闭环的效率和迭代速度可能不及Waymo。
9 分钟 · 3 卡片 · 7 资料
读原文 →