8.3
深览指数
科技虎嗅·冷眸··AI 生成

把爱因斯坦的知识喂给大模型,它能发明相对论吗?

本文基于 Google DeepMind 研究员 Tom Zahavy 的论文《LLMs can't jump》,系统论证了当前大语言模型(LLM)在科学创造力上的结构性缺陷。核心结论是:LLM 精于归纳(数据压缩)和演绎(形式化证明),但无法完成科学发现必需的“溯因(Abduction)”飞跃——即凭空提出全新公理假设的能力。作者以爱因斯坦提出广义相对论的历史为案例,指出当时缺乏足够的数据误差信号,驱动发现的是来自具身仿真的物理直觉,而非数据拟合。文章为深度读者提供了理解 AI 科学能力边界、区分“数据压缩”与“真正发明”的清晰框架,并指出了未来 AI 架构(物理一致性世界模型)的发展方向。适合对 AI 前沿、科学哲学、AGI 技术路线感兴趣的读者。原文 ↗

核心观点
  • 当前大语言模型(LLM)在结构上无法完成科学发现所必需的“溯因(Abduction)”飞跃,即凭直觉提出全新公理假设的能力,其精通的归纳与演绎不足以支撑真正的发明。
  • 真正科学发现的瓶颈在于从感官经验到公理体系(E→A)的直觉“跳跃”,这一过程高度依赖具身仿真与物理先验,而非数据压缩或逻辑推导。
  1. 01在爱因斯坦提出广义相对论时,牛顿引力并未面临经验性危机,水星近日点进动等微小异常被归因于未知行星“火神星”,不存在驱动模型优化的“误差信号”。
  2. 02论文采用皮尔士(C.S. Peirce)的逻辑框架,区分了三大推理类型:演绎(规则+案例→结果)、归纳(案例+结果→规则)和溯因(规则+结果→案例)。LLM 擅长前两者,但无法完成后者。
  3. 03爱因斯坦的“最幸福想法”(等效原理)源于“电梯思想实验”这一具身仿真,他通过想象坠落观察者的物理感受,凭空构建了新的公理,而非基于数据统计。
  4. 04在 1913 年至 1915 年的“整合期”,爱因斯坦与数学家 Grossmann 合作,已识别出黎曼曲率张量,却因一个“致命错误”(误以为无法在静态场回归牛顿引力)而放弃,导致理论推迟两年。
反方 / 局限
  • 作者指出,像 Sakana AI 的“AI Scientist”和 DeepMind 的“AlphaEvolve”等系统,虽然能实现科学循环的机械化与进化优化,但它们本质上仍是“中文屋”操作,在固定框架内优化指标,缺乏感官接地和反事实物理仿真的能力。
  • 文章承认,在数学或计算机科学等抽象领域中,“感性经验”(E)可能建立在高维拓扑或形式系统上,溯因跳跃的性质必须适应学科本体论,并非所有科学发现都依赖物理世界的具身仿真。
29 分钟 · 5 卡片 · 15 资料
读原文 →

前置背景

论证骨架

平行视角

未来推演

延伸追问