7.3
深览指数
科技量子位·henry··AI 生成

Nature:AI重生到1900,这一世抢先爱因斯坦提出光量子

诺奖得主哈萨比斯提出“爱因斯坦测试”:将AI置于1911年的知识水平,看它能否在没有答案模板的情况下独立提出超越训练材料的物理理论。独立研究者Michael Hla将知识截止点提前至1900年,训练出GPT-1900模型,模型在某次回答中确实吐出了一段类似光量子描述的文本,但在绝大多数物理任务上失败,且实验存在现代模型Claude介入的数据污染问题。文章进一步探讨了当前AI在科学发现中的根本局限:它们擅长归纳和演绎,但缺乏爱因斯坦式的“溯因飞跃”——从零创造全新解释框架的能力,也无法自主判断哪个理论值得深究。适合关注AI前沿、AGI评估方法、科学哲学的研究者和技术爱好者阅读。原文 ↗

核心观点
  • 哈萨比斯提出的“爱因斯坦测试”旨在检验AI能否仅以历史知识水平、在没有答案模板的情况下完成超越训练材料的科学推理,这是检验AGI的一项有力测试。
  • 当前AI擅长归纳和演绎,但缺乏爱因斯坦式的“溯因飞跃”——从零创造全新解释框架的能力,也难以自主判断哪个理论值得投入时间和资源去验证。
  1. 01Michael Hla训练了33亿参数的GPT-1900模型,使用220亿token的1900年前书籍和报纸及2.9亿token的历史物理语料,并过滤了包含“爱因斯坦”“量子力学”等现代概念的数据。
  2. 02GPT-1900在一次回答中输出“光可能不是连续的,而是由许多彼此分离、频率不同的部分组成”,与爱因斯坦1905年光量子论文的描述高度相似。
  3. 03Hla承认GPT-1900在大多数物理任务上失败,其亮眼回答依赖人类整理好的问题和提示;实验借助Claude Sonnet 4等现代模型进行指令生成和评分,未能做到零污染。
  4. 04MIT计算机科学家Jacob Andreas指出,会生成理论只是第一步,AI真正的分水岭在于能否判断哪个想法值得深究、评估其重要性。
  5. 05DeepMind研究员Tom Zahavy的论文《LLM无法跳跃》将科学推理分为归纳、演绎和溯因三层,认为大模型仍缺少溯因飞跃。
反方 / 局限
  • Hla的实验未能隔离现代知识污染,GPT-1900的表现可能只是知识召回而非真正的科学发现,研究者难以证明模型没有偷看答案。
10 分钟 · 5 卡片 · 8 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问