科技虎嗅·陈伊凡_YF··AI 生成
50万小时,全球第一:具身的关键数据握在这家中国公司手里
本文专访北大教授、智在无界(BeingBeyond)创始人卢宗青,深入剖析其选择了一条与当时主流(软硬一体、仿真数据)截然不同的技术路线:纯做具身基础模型,且用海量人类第一人称视频而非仿真/真机数据预训练。文章核心论点是,具身智能的通用基础模型才是瓶颈,而硬件未收敛前不应被绑定,人类视频是最易规模化的数据路线。作者立场鲜明,提供了从2023年失败实验到2025年行业集体转向的完整推理链条,适合关注具身智能技术路线博弈、模型与硬件分工的深度读者。原文 ↗原文 ↗
核心观点
- ▍具身智能最本质的瓶颈是通用具身基础模型,硬件未收敛前,纯做模型公司不应被硬件绑定,这是与当时主流“软硬一体”共识的差异。
- ▍大规模人类第一人称视频是训出通用基础模型的最可能数据路线,其规模化能力远超仿真数据和真机数据,这一判断在2025年下半年成为行业共识。
- 01公司从2023年底开始押注人类视频,当时无人跟进;视频数据量从H0的3000小时迭代到H0.8的50万小时,达到全球具身模型头部。
- 02H0.5支持跨本体控制30多种机器人,H0.7采用隐式世界动作模型(latent world action model),H0.8在预训练中融入触觉标注。
- 03其训练范式算力消耗仅为基于视频生成模型的百分之一,端侧推理速度可做到30赫兹,是全球世界模型中最快的。
- 04融资恰逢2025年初一级市场对具身信心下行的节点,投资人反复拷问核心问题:为什么不做硬件?为什么用人类视频数据?
- 05产线上仍有很多人从事非单一工种,纯人形机器人并不能很好适应;公司商业化分license卖模型和后训练服务,以及探索高价值标杆场景。
反方 / 局限
- — 作者承认,纯做模型公司的劣势是收入不如软硬一体公司,且当前尚未观察到模型涌现(类似GPT-3.5的突破),仍处于线性爬坡阶段。
- — 作者承认,50万小时到千万小时的数据量“可能”才能训出通用模型,但“怎么把这些数据转化成模型”的方法(学习范式)尚未掌握,不能保证当前方法就是最终方法。
19 分钟 · 5 卡片 · 11 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问