6.7
深览指数
科技量子位·henry··AI 生成

Show me《指环王》!卡帕西强推大模型评测新基准

卡帕西(Andrej Karpathy)宣布,Anthropic 正在用《指环王》文本作为输入,要求 Opus 5 模型通过 Three.js 生成一个完整的 3D 中土世界,以替代已显过时的「鹈鹕骑自行车」SVG 测试。该测试耗时 2 小时、消耗 100 万 token、输出 5500 行代码,暴露了当前模型在「理解视频」和「自主玩自己生成的游戏」方面的短板。文章还展示了网友基于此思路的衍生作品,如 AI 生成的 3D 演唱会与虚拟城市,并讨论了这一测试对空间推理能力的真正价值。适合关注 AI 能力边界、模型评测方法及 3D 生成技术前景的读者。原文 ↗

核心观点
  • Anthropic 提出以《指环王》文本驱动 Three.js 生成 3D 世界作为新的大模型能力基准,替代已显过时的「鹈鹕骑自行车」SVG 测试,核心在于考察模型对复杂空间关系、长时间项目规划与自我修正的能力。
  • 当前模型能写代码、搭场景、生成游戏,但还不能真正看懂视频或亲自玩自己生成的游戏,这是其重要短板。
  1. 01Opus 5 使用《指环王》第一章开头文本,在 Three.js 中生成 3D 中土世界,耗时 2 小时、消耗 100 万 token、输出 5500 行代码。
  2. 02生成的 3D 场景画面粗糙,类似 90 年代末国产 3D 动画,存在穿模、漂浮等问题,但整体场景结构完整。
  3. 03卡帕西提出,程序化 3D 与视频生成并非二选一,可先用 Three.js 搭骨架,再通过视频模型(如 Seedance)补纹理与光影,音频则使用 ElevenLabs。
  4. 04网友基于此思路的衍生作品包括:AI 生成的旧金山滨水区(低多边形风格)、纽约市 3D 数字模型(接入实时数据)、以及 Kanye West 演唱会虚拟体验(共 14 首歌,每首歌独立灯光设计)。
  5. 05「鹈鹕骑自行车」SVG 测试曾用于考察模型的空间理解与物体组合能力,但随着模型提升(如 DeepSeek R1/V4 表现良好),该测试已无法区分差距。
反方 / 局限
  • 有批评者认为,Three.js 测试可能只证明模型在 Three.js 代码上训练充分,而非真正理解空间与物理世界。
  • 反对者指出,该测试消耗大量 token 和算力,对比简洁廉价的「鹈鹕测试」在实践中评估成本过高。
  • 文章未深入探讨「空间推理」是否与文字/代码推理本质相同,以及该测试在多大程度上能区分模型能力的真实进步 vs 针对 Three.js 数据的过拟合。
14 分钟 · 4 卡片 · 9 资料
读原文 →

概念锚点

前置背景

未来推演

延伸追问