7.4
深览指数
科技智东西·程茜··AI 生成
攀爬AGI的南北坡:语言模型之外,生数从世界模型出发
本文以智谱和生数科技为对照,提出通往AGI的两条路线:一条从语言和符号模型出发,另一条从世界模型出发。核心是生数科技基于朱军团队提出的通用世界模型五级演进路线(L1世界生成→L5多智能体协同),以及其最新发布的面向灵巧操作的Motus2模型,该模型将评估与反馈显式纳入统一框架。文章认为,中国AGI不再只是追赶海外路线,而是在语言智能与物理世界智能两个方向均形成了原生探索。适合对AGI技术路线分化、世界模型技术架构感兴趣的深度读者。原文 ↗
核心观点
- ▍通往AGI正在形成两条原生路线:一条以语言模型与智能体为核心(智谱代表),另一条以世界模型为核心,从视频生成、实时交互走向世界行动模型(生数代表),这两条路线分别从人类编码的语言知识和物理世界的持续反馈出发。
- ▍生数科技的技术路线遵循朱军团队提出的通用世界模型五级演进:L1世界生成(Vidu Q3)、L2交互(Vidu S1)、L3世界行动(Motus/Motubrain)、L4自主世界智能体、L5多智能体协同。最新的Motus2将评估与反馈显式纳入模型,形成行动-预测-评估-反馈的闭环。
- 01李飞飞与World Labs团队在2025年6月发布《A Functional Taxonomy of World Models》,从POMDP框架出发,将世界模型功能概括为渲染器(输出像素)、模拟器(输出状态)和规划器(输出行动)。
- 02朱军团队2025年8月发布《General World Models from First-Principles》,提出通用世界模型第一性原理:理解、想象、行动构成一条不能断开的因果链,并定义了L1-L5的五级演进路线。
- 03生数科技Vidu Q3支持单次最长16秒视频生成、音频与画面同步、多人对话及多语言文字与视频一体生成。
- 04生数科技Motubrain采用语言、视频、动作三流Mixture-of-Transformers(MoT)架构,将场景理解、世界状态预测与动作生成放入统一框架。
- 05朱军团队提出免训练推理算法Analytic-DPM、DPM-Solver,获ICLR杰出论文奖,被OpenAI、苹果、Stability.ai采用,应用于DALL·E 2、Stable Diffusion。
- 06朱军是国内极少数同时获得IEEE、AAAI、ACM三大国际学会Fellow的青年计算机科学家。其学生宋飏(Meta超级智能实验室研究负责人)、宋佳铭(前Luma AI首席科学家)均为扩散模型领域奠基者。
反方 / 局限
- — 文章承认Motus2仍建立在L3在世界中行动的能力之上,只是向L4自主世界智能体迈出的初步尝试,并未真正达到自主评估与长期规划。
- — 文章未讨论世界模型路线与语言模型路线相比,在通用性、数据效率、可迁移性上的劣势,也未提及在机器人领域世界模型是否比强化学习或示教学习更有效。
生数科技智谱AI朱军骆怡航李飞飞World LabsMotus2MotubrainVidu Q3Vidu S1通用世界模型五级POMDPMixture-of-Transformers (MoT)Analytic-DPMDPM-Solver宋飏宋佳铭Meta超级智能实验室Luma AI
15 分钟 · 5 卡片 · 15 资料
读原文 →