7.8
深览指数
科技人人都是产品经理·Z Finance··AI 生成

四张榜单,四种真相:WAIC 之后,世界模型到底该看哪个排名?

文章以2026年WAIC大会为背景,系统梳理了当前衡量世界模型与具身智能能力的四张核心榜单:VBench(视频生成质量)、WorldModelBench(物理常识理解)、RoboTwin 2.0(机器人任务执行)和Physics-IQ(物理预测准确性)。作者指出,不同榜单回答不同层次的能力问题,且彼此不互斥。核心发现是,生成逼真(如Sora在VBench上的表现)与预测准确(如Physics-IQ上的低分)是两回事。文章通过Physics-IQ榜单上Magi-1的意外登顶,引出了架构差异(扩散 vs 自回归)对模型世界理解能力的根本性影响。适合对AI技术路线、模型评测体系有深度兴趣的读者,尤其适合在评估不同公司技术实力时作为参考框架。原文 ↗

核心观点
  • 目前没有单一榜单能定义世界模型,VBench(画质)、WorldModelBench(常识)、RoboTwin(执行)、Physics-IQ(物理预测)四张榜单分别回答“像不像”、“懂不懂”、“动不动”、“准不准”四个层次的问题,拼在一起才构成完整的能力图景。
  • 模型生成的视频“逼真”与对物理世界的“预测准确”是两回事:Sora 2在VBench上表现不错,但在Physics-IQ上裸模型得分仅42.3%,不足榜首Magi-1的2/3。
  1. 01VBench从16个维度评价视频生成质量,头部模型得分集中在84-88分,差距很小;2.0版本增加了物理、可控性等维度。
  2. 02WorldModelBench测试中,最好模型只有61%的视频正确完成指令,12%违反质量守恒,11%出现物体互相穿透。
  3. 03RoboTwin 2.0包含50个双臂操作任务,在Hard设定下多数方法成功率低于20%。
  4. 04Physics-IQ基于66个真实物理实验,模型只看前3秒预测后5秒,Magi-1以56.0%得分登顶,远高于Google VideoPoet的29.5%。
  5. 05Magi-1采用自回归逐块生成架构,按时间顺序预测,与扩散模型一次性生成所有帧的方式不同,更接近“预测下一个词”的逻辑。
  6. 06Physics-IQ Verified修正版榜单上,Magi-1 24B增强版58.2分排第一,Sora 2仅26.5分。
反方 / 局限
  • 文章虽然指出Physics-IQ是更底层的评测,但也承认其2026年6月发布的修正版修正了57.6%的样本标注问题,说明原始榜单存在数据标注偏差,其结论的可靠性仍有待验证。
  • Magi-1在Physics-IQ上的领先建立在特定评测设定(v2v)上,英伟达Cosmos3-Super在增强系统(WMReward)下得分更高(63.4%),说明不同设定下的排名不完全可比,榜首位置存在争议空间。
13 分钟 · 4 卡片 · 12 资料
读原文 →

概念锚点

前置背景

平行视角

延伸追问