科技 量子位 · 允中 · 2小时前 · AI 生成
ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%? 文章以OpenAI宣称解决千禧年难题与PaperBenchX测试中AI模型论文复现率仅13.98%的巨大反差切入,系统介绍了首个多学科端到端论文结果复现基准PaperBenchX的设计理念、评测逻辑和关键发现。作者指出,当前AI在独立建模和执行方面表现尚可,但验证环节薄弱,能跑出合理数字不等于科学上做对了。文章意在推动评测标准从「解决难题」回归到「可靠复现」,对关注AI for Science落地、科研范式变革的读者有参考价值。原文 ↗ 原文 ↗
核心观点
▍ 当前AI在攻克数学难题等「高光」任务上取得突破,但在端到端论文结果可靠复现这一基础科学能力上表现极低,二者之间存在巨大鸿沟。 01 OpenAI宣称AI模型88小时破解N-S方程,但PaperBenchX评测中表现最强的GPT-6 Astra,在93个真实论文复现任务中完整复现率仅为13.98%。 02 PaperBenchX是首个横跨电磁、光子、化学、材料、生物、机器人等12个研究方向、10种领域原生科学环境的论文复现基准,包含3168条专家校验的评分项。 03 评测采用「断网重跑」机制:Agent交卷后系统删除全部输出、切断网络,在隔离环境中从头执行工作流,评分器只认重放产物。 04 在10组受测配置中,建模和执行阶段平均分分别为62.70%和61.84%,但验证阶段平均分仅有42.80%,表明AI难以判断自身产出的科学可靠性。 05 前期决策(论文理解、科学建模、参数选择)的效率决定了后续计算的价值,例如Fable 5模型将37.1%时间用于前期重建与实现,反而能以较少交互取得接近最优的分数。 06 PaperBenchX将论文复现任务拆解为理解科学问题、正确完成科学仿真、判断结果是否可信三个层次,并与已有基准(如OpenAI PaperBench)形成核心区别——后者局限于ML/Python栈。 反方 / 局限
— 文章暗示,13.98%的完整复现率虽然很低,但部分进展是真实的,Agent在建模和执行上已取得阶段性成功,差距集中在验证环节。 — 文章指出,复现任务无法完全模拟真实科研的「先验不确定性」:真科学发现通常是提新问题,而非验证已知结论。
概念锚点 13.98% 的真实距离
GPT-6 Astra 在 PaperBenchX 的 93 个跨学科论文复现任务中,完整复现率仅 13.98%。这不是模型能力不足,而是科学复现的底层逻辑决定了它很难:70 道题没有任何一个 Agent 配置能完全过关。模型在建模和执行阶段平均得分超过 60%,一到验证环节就骤降到 42.8%——能跑出数字,但证明不了数字在科学上是对的。PaperBenchX 用断网重跑机制堵死了蒙混过关的路径,让 AI 与 General AI Scientist 之间的这段距离第一次被量化了出来。
▸ 1 条关联资料
▼
前置背景 OpenAI 如何拿下千禧难题
OpenAI 在 2026 年 9 月宣布其 AI 系统攻克了 N-S 方程存在性与光滑性问题——这是七大千禧年难题之一,悬赏百万美元。做法不是单模型硬解,而是 1 万个 Agent 并行协作 88 小时,分成对立证明路线互相拆解,最终构造出平滑外力下的有限时间爆破反例。论文随后由 GPT-6 Astra 翻译成 Lean 形式化代码供机器校验。陶哲轩的点评一针见血:这是理论数学的病态解,对工程应用几乎没影响。而且克雷研究所官网至今仍标记为未解决。
▸ 1 条关联资料
▼
平行视角 硅谷狂欢,学界冷却
OpenAI 宣布攻克 N-S 方程后,硅谷舆论一片沸腾,但数学界反应冷淡。美国数学学会主席公开称为「里程碑式进步」,同时指出数学界更关心 AI 能否走完完整的验证链条——而 PaperBenchX 恰好戳中这个盲区。路透独家报道则揭露了 OpenAI 的方案与纽约大学数学家巴克马斯特的思路高度重合,引发「截胡」争议。同一笔账两种叙事:一边当成就宣传,一边质疑过程不透明。
▸ 2 条关联资料
▼
未来推演 通用 AI 科学家的三个关卡
PaperBenchX 的测试结果清晰地标出了通往 General AI Scientist 路上的三个瓶颈:理解科学问题、正确执行科学仿真、判断结果是否可信。目前模型卡在第三关——验证环节得分 42.8%,是唯一不及格的阶段。未来可观察的关键变量是:AI 能否在仿真过程中学会自检收敛性、识别数值发散、判断参数合理性。UniPat 团队已开源 12 个代表性任务供社区攻关,81 个封测任务则用来追踪年度进步。
▸ 1 条关联资料
▼
延伸追问 没有 Lean 兜底的学科怎么办
数学证明有 Lean 做最后防线:每一步逻辑机器能逐行校验,答案真假有兜底。但电磁仿真里的反射系数、材料模拟中的带隙、化学反应的产率,都没有等价物。PaperBenchX 试图为科学仿真搭一道「Lean」——删输出、断网、重跑、只认重放产物。这引出一个根本问题:如果物理、化学、生物领域的科研结论无法被一键形式化验证,AI for Science 的「可信」边界到底该画在哪?
▸ 2 条关联资料
▼