科技Bestblogs·机器之心··AI 生成
RoboPapers 专访光轮智能谢晨:具身 Scaling Law 的两座金字塔
光轮智能创始人谢晨提出,具身智能的规模化(Scaling Law)依赖两座金字塔:可规模化的人类数据用于训练,可规模化的仿真用于评测。公司通过构建集采集、自动标注、质检于一体的数据引擎,将人类第一视角数据转化为本体无关(Robot-Agnostic)的标准数据产品,并以此驱动仿真评测形成闭环。本文的核心贡献在于系统阐述了数据规模化策略、质量四维标准以及数据驱动仿真的逻辑,适合关注具身智能数据基础设施的从业者阅读。原文 ↗原文 ↗
核心观点
- ▍具身智能的 Scaling Law 需要两座金字塔:训练金字塔依赖可规模化的人类数据提供跨任务经验,评测金字塔依赖可规模化的仿真来快速验证能力与诊断失败模式。
- ▍机器人数据的出路在于 Robot-Agnostic Data(本体无关数据),人类第一视角数据具有跨本体复用的潜力,是具身基础模型最具规模化能力的来源。
- 01光轮智能打造了一个集采集、自动标注、质检于一体的人类数据引擎,将人类数据转化为可复用的标准品,实现了高效流通与规模化供给。
- 02光轮智能提出数据质量的四个关键维度:视频质量(清晰稳定)、手部位姿(精确标注)、语义标注(动作级理解)、多样性(覆盖不同场景和任务)。
- 03为避免仿真陷入无限探索空间,光轮智能从真实世界的第一视角数据中提取代表性任务与场景,将其转化为仿真测试环境,形成数据驱动的仿真评测。
- 04光轮智能建立了一个持续反馈闭环,用人类反馈不断改进数据标注和自动化流程,类似于 RLHF 策略在数据生产环节的应用。
- 05光轮智能的数据已在多个国际顶级机器人实验室、世界模型项目中应用,并进入 Figure AI 的供应商体系。
反方 / 局限
- — 文章承认人类数据采集速度仍然受限,数据生产速度尚未能满足模型训练的全部需求,规模化瓶颈依然存在。
- — 仿真与真实世界的差距(Sim-to-Real Gap)仍是核心挑战,虽然数据驱动的仿真设计旨在缩小这一鸿沟,但文章未详述如何系统性地验证覆盖所有长尾场景。
概念锚点
前置背景
平行视角
未来推演
延伸追问