7.7
深览指数
科技Bestblogs·十字路口Crossing··AI 生成
于是转身向具身走去|对话王家伟:深朴智能 00 后首席科学家
深朴智能首席科学家王家伟主张在通用大模型(大脑)之下,必须建立一个专门的 Action Foundation Model(小脑),才能让机器人具备应对物理世界动态变化的毫秒级反应能力。文章详细拆解了深朴智能自研高精度 UMI 数据采集设备、构建 HiFi-UMI 数据集的技术路线,以及在适应能力、可操控性、上下文理解三个核心能力上的攻关思路。适合对具身智能技术路线(而非产业落地)感兴趣的从业者阅读。原文 ↗
核心观点
- ▍具身智能需要「大脑」(通用大模型,负责规划与理解)与「小脑」(Action Foundation Model,负责毫秒级动态调整与肌肉反应)的分工协作,不可用单一模型包办。
- ▍高质量、高多样性的数据是实现 Zero-Shot 泛化与「小脑」能力的关键,深朴智能通过自研 UMI 手套(抛弃基站、微秒级时间戳同步)采集高精度数据。
- 01通用大模型(如 GPT-6 Astra)在规划和理解上极强,但面对物理世界的突发状况(如物体打滑),其反应速度(秒级)远不足以满足需求,需要具备毫秒级反应的小脑。
- 02深朴智能自研的 UMI 数据采集设备通过超短时间戳同步多个摄像头数据,实现了对 50-60cm 距离内 2-3mm 级别动作的精准复现,无需依赖昂贵基站。
- 03基于 HiFi-UMI 数据集训练「小脑」模型,在 Zero-Shot 测试中,机械臂可从地面捡起掉落的螺丝刀并放入工具箱,该技能在训练数据中仅含桌面操作,未见地面场景。
- 04具身智能决策需处理三个层级的上下文:短时(高频因果,如物体物理状态变化)、中时(工作记忆,如已摆放物品的数量)、长时(长程任务规划,如「做三菜一汤」的子步骤)。
- 05深朴智能的做法是训练一个通用 Action Policy,在面对新场景时,通过 Transformer 的上下文学习(In-Context Learning)自适应调整,而非针对特定任务做后训练微调。
- 06Scaling Law 在具身智能数据维度上同样成立,实验观察到数据多样性一旦跃迁(如在桌面数据中引入地面数据),模型在零样本任务上的成功率会出现跳变。
反方 / 局限
- — 作者承认具身智能目前缺乏公认的标准测试基准,不同团队使用不同硬件、不同数据集,导致「进步」难以横向比较,行业存在大量只能跑预定轨迹的美化 Demo。
- — 文章顺带提及,多数具身智能团队(包括头部大厂)仍在依赖配对数据(Paired Data)做硬训练的 In-Context Learning,这与深朴智能追求的「零样本泛化」路线存在根本差异,但作者未深入分析此路线各自的优劣条件。
王家伟深朴智能Action Foundation ModelUMI (Universal Manipulation Interface)HiFi-UMIGPT-6 AstraScaling LawZero-Shot 泛化
3 分钟 · 3 卡片 · 6 资料
读原文 →