7.7
深览指数
科技微博·晚点LatePost··AI 生成
对谈补天石白宇利:从智驾到具身,我想把数据闭环再做一次
补天石科技创始人白宇利认为,具身智能行业当前最大的瓶颈不是硬件或算力,而是规模化、低成本的真实数据稀缺。他借鉴智驾领域十年经验,提出用自研硬件在真实场景采集人的操作数据,建立数据闭环。文章详述了具身数据与智驾数据的本质差异(机器人没有天然的使用场景可顺带采数据),以及补天石在数据获取、定义、处理、交付四个环节的具体做法。适合关注具身智能、AI数据基础设施的从业者和投资人阅读。原文 ↗
核心观点
- ▍具身智能当前最大的瓶颈不是硬件、算力或人才,而是规模化、低成本的真实数据稀缺,且机器人没有如智驾般天然的使用场景可顺带采集数据。
- ▍补天石的定位是物理AI基础设施,核心是建立一套从数据获取、定义、处理到交付的闭环系统,并沉淀出有复利的SOP、标准工艺和核心算法,而非做纯线性增长的数据标注生意。
- 01白宇利在Momenta时用9个月采集了5亿帧真实道路图像,支撑初代感知算法训练;在蔚来则搭建了覆盖上百万辆量产车的数据系统,实现了从100辆实验车到百万辆量产车的规模化迭代。
- 02具身数据采集存在一个“光谱”:最左侧是真实操作数据,准确但贵、少、泛化性差;最右侧是互联网数据,量大但信息密度低。补天石采用Ego方案(人戴传感器采集操作数据)作为中间态。
- 03补天石的服务流程分四步:数据获取(自研Ego套件)、数据和任务定义、数据处理(手部/肢体识别、行为描述)、交付模型并获取反馈,形成闭环。
- 04白宇利认为行业需要的数据量可能比智驾大一到两个量级,但具体数字难以脱离数据质量给出统一答案,因为泛化预训练数据与场景微调数据的需求不同。
- 05智驾领域可复用到具身的是数据飞轮、数据闭环的研发范式,以及规模化采集、处理真实世界数据的infra能力;不可复用之处包括精度要求(毫米级vs米级)、场景复杂度(居家场景量级远超道路)、迭代效率。
反方 / 局限
- — 白宇利承认,目前模型团队往往难以完整定义自己需要什么数据,算法需求与数据供给之间存在巨大鸿沟,这是补天石必须解决的“翻译”问题,也是其价值所在。
- — 文章暗示,补天石面临的直接竞争对手包括光轮智能(押注仿真路线),以及大厂自建in-house数据团队的可能性。白宇利认为外部公司的优势在于决策快、可做共性建设,但大厂资源充裕时也可能选择自建。
17 分钟 · 3 卡片 · 9 资料
读原文 →