7.4
深览指数
科技微博·量子位··AI 生成

美国具身也没成熟!PI:中国公司何必总当“中国版XX”|RSS 2026

本文是量子位在RSS 2026现场的观察与访谈记录,核心观点是美国头部具身智能公司离成熟尚远,中国在机器人硬件上领先,不应自贬为“中国版XX”。文中涉及多位学者和从业者对VLA与世界模型之争、数据重要性、全身智能、硬件出海等话题的多元看法,呈现了与国内热门叙事不同的冷静判断。适合关注具身智能前沿动态、希望了解产业一线真实分歧的从业者和研究者阅读。原文 ↗

核心观点
  • 包括Physical Intelligence在内的北美头部具身智能公司离成熟尚远,整个领域尚未出现真正的奠基性工作。中国在机器人硬件上领先,不应自称为“中国版XX”。
  • VLA与世界模型并非互斥关系,不同任务需要不同的处理方式;世界模型的关键在于预测什么,以及预测能否真正服务于动作执行。
  1. 01RSS 2026论文从截稿到会议历时近五个半月,导致会场呈现的成果多为大半年甚至一年前启动的技术,难以反映近几个月的行业热点。
  2. 02Physical Intelligence的实习生认为VLA和世界模型可以并存,不同任务分别需要语言推理和视频预测能力;并反问‘你真的看到世界模型做到预测动作后果了吗?’
  3. 03EgoVerse核心作者Simar Kareer指出,数据量并非唯一关键,数据如何筛选、配比和整理(curation)同样重要,建议参考π0的训练规模(1万小时)。
  4. 04斯坦福教授Karen Liu在闭幕演讲中提出机器人领域‘模型丰富,数据贫乏’,主张利用已有的仿真、规划、视觉模型作为教师,自动生成训练数据。
  5. 05香港大学李弘扬教授提出‘全身智能’概念,指机器人需将移动、平衡、操作视为整体,而非拆解为独立模块。
  6. 06RSS展台前,中国机器人厂商的硬件出海领先于软件和数据服务,海外用户更关注价格、投资回报和本地场景(如矿山、巡检)。
反方 / 局限
  • 国内‘VLA已死,世界模型当立’的叙事与RSS现场以VLA为主的情况存在明显偏差,反映出国内外信息节奏和审稿周期的差异。
  • 触觉传感器在VLA中的集成仍面临数据稀缺、传感器迁移难、机器人形态影响等难题,并未像理论上那样容易解决。
  • 当前视频预测虽能生成视觉上合理的未来状态,但缺乏对机器人手部尺寸、物体大小等动作相关信息的感知,难以直接转化为可靠操作。
23 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问