科技腾讯新闻·爱范儿··AI 生成
李飞飞教机器人摸麻将挤牙膏,AI 终于有“手感”了
文章以李飞飞团队的最新研究T-Rex为引,论证了具身智能从“视觉识别”到“物理交互”的范式转变。核心观点是:AI仅靠视觉和语言模型的“常识”无法应对物理世界,必须整合触觉、力反馈和模拟器,形成“看-想-摸”的闭环系统。文章通过大量案例(胸片问答的“幻景推理”、模拟器训练、机器人触觉反馈)阐明了这一转向的技术逻辑,适合对AI和机器人领域有基础认知、希望理解前沿技术挑战的读者。原文 ↗原文 ↗
核心观点
- ▍具身智能的下一步不是让AI“看到”世界,而是让AI通过触觉、力反馈和模拟器,在物理世界中获得“可计算、可碰撞、可交互”的感知,完成从“画世界”到“干世界”的转变。
- 01李飞飞2025年参与的T-Rex研究,为机器人集成高频触觉反馈,在12项精细操作任务中(翻书、挤牙膏、拧灯泡等)平均成功率达65%,比最强对照模型高出30个百分点。
- 02研究发现,直接将触觉数据塞入视觉-语言-动作模型效果很差,因为视觉和触觉工作速度不同,触觉必须以更高频率即时调整(如杯子滑落时),而视觉负责慢速的全局规划。
- 032025年3月的一项实验显示,多模态模型在未输入图片的情况下,仍能在胸肺X光问答基准中取得高分,研究者称之为“幻景推理”,表明模型基于语言线索而非真正视觉观察来回答问题。
- 04World Labs将当前“世界模型”分为三类:渲染器(生成像素)、模拟器(表示几何与物理)、规划器(决定动作),表明能生成流畅视频的模型不一定能理解物理世界。
- 05英伟达Cosmos和逐际动力TRON 1等平台,通过仿真环境(MuJoCo、Gazebo等)让机器人先在虚拟世界中反复失败,以低成本、高效率积累训练数据,但面临“仿真到现实差距”问题。
- 06Figure Helix 02机器人集成了头部摄像头、手掌摄像头、指尖触觉传感器(可感知低至3克的力),实现了从药盒中取出单颗药片等精细操作。
反方 / 局限
- — 模拟器无法完全模拟真实世界的摩擦力、材料变形等物理参数,导致机器人在从虚拟环境迁移到现实时,仍会遇到“仿真到现实差距”这一机器人行业长期面临的挑战。
11 分钟 · 5 卡片 · 12 资料
读原文 →前置背景
技术原理
平行视角
未来推演
延伸追问