7.7
深览指数
科技微博·机器之心Pro··AI 生成
世界模型到底是什么?李飞飞、朱军等如何解读?
本文梳理了当前 AI 领域对「世界模型」概念的多重定义与分歧,核心贡献在于介绍了朱军团队从第一性原理出发构建的通用世界模型(GWM)框架——包含理解、想象、行动三项核心能力与五级进化路线图。文章澄清了视频生成不等于世界模型,并解释了生数科技如何通过视频生成与具身智能两条产品线验证同一假设。适合关注 AGI 技术路线、生成模型与具身智能交叉领域的从业者与研究者阅读。原文 ↗
核心观点
- ▍「世界模型」概念当前极度混乱,不同团队的实际技术路线差异显著,需从第一性原理定义核心能力,将视频生成、实时交互、潜空间预测和机器人控制视为同一能力路线上的不同阶段。
- ▍朱军团队提出的通用世界模型(GWM)框架以「理解、想象、行动」三项核心能力构成闭环,并给出了从L1生成世界到L5世界组织者的五级进化路线图,为技术讨论提供了可检验的标尺。
- 01世界模型概念的分歧表现为:生成视频画面可逼真但可能违背物理规律;机器人抓取可能仅熟悉实验室场景。这些系统在「学到视觉相关性」「物理结构」还是「行动与结果关系」上存在根本区别。
- 02李飞飞和World Labs按功能将世界模型分为渲染器(输出像素)、模拟器(输出世界状态)和规划器(输出动作);LeCun主张在抽象潜空间中学习可预测的世界结构。
- 03GWM框架的三项核心能力定义为:理解(整合多模态信息形成内部判断)、想象(推演多种可能未来)、行动(对世界进行干预并用新观测修正模型)。
- 04五级路线图:L1生成连贯内容;L2世界可响应交互;L3模型能改变物理环境;L4系统能主动探索与持续学习;L5组织开放环境的多主体协作。论文判断当前系统已触及L3,L4和L5仍是开放问题。
- 05数据策略采用金字塔结构:底层互联网视频(世界知识与动态先验)→领域视频→第一视角人类视频→带动作记录的人类示范→顶层真实机器人交互数据(动作、任务、本体对应关系最清楚)。
- 06Motus2 将动作生成、未来模拟和结果评估整合为共享参数的视频-动作模型,暴露策略、模拟器、评估器三种控制接口,让机器人行动前可先预演后果,行动后利用结果改进策略。
- 07生数科技的两条产品线(视频生成Vidu系列、具身智能Motus系列)形成对同一世界模型假设的两次验证,分别检验在数字环境和物理环境中的能力。
反方 / 局限
- — 作者指出Motus2当前验证主要集中在特定机器人和操作任务,自主目标形成、持久记忆、开放环境泛化、长期在线学习与安全控制仍有待探索。
- — 文中隐含的张力:朱军团队自己的路线图认为现有系统仅触及前三级(L3),但业界不少团队已将更简单的视频生成模型标榜为「世界模型」,这种命名竞赛会误导技术判断和资源投入。
- — 从AGI路线对比看,本文暗示了「从语言出发」的路线(如智谱)与「从视觉与动态世界出发」的路线(如生数)之间的竞争与渗透关系,但未深入讨论哪条路线在成本、可扩展性和泛化能力上更具优势。
李飞飞朱军LeCunWorld Labs清华大学TSAIL实验室生数科技智谱MotusMotus2通用世界模型 (GWM)Vidu五级路线图Mixture-of-Transformers (MoT)Kenneth Craik宋飏宋佳铭
11 分钟 · 4 卡片 · 12 资料
读原文 →