7.8
深览指数
科技量子位·允中··AI 生成

ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?

文章以OpenAI宣称解决千禧年难题与PaperBenchX测试中AI模型论文复现率仅13.98%的巨大反差切入,系统介绍了首个多学科端到端论文结果复现基准PaperBenchX的设计理念、评测逻辑和关键发现。作者指出,当前AI在独立建模和执行方面表现尚可,但验证环节薄弱,能跑出合理数字不等于科学上做对了。文章意在推动评测标准从「解决难题」回归到「可靠复现」,对关注AI for Science落地、科研范式变革的读者有参考价值。原文 ↗

核心观点
  • ▍当前AI在攻克数学难题等「高光」任务上取得突破,但在端到端论文结果可靠复现这一基础科学能力上表现极低,二者之间存在巨大鸿沟。
  1. 01OpenAI宣称AI模型88小时破解N-S方程,但PaperBenchX评测中表现最强的GPT-6 Astra,在93个真实论文复现任务中完整复现率仅为13.98%。
  2. 02PaperBenchX是首个横跨电磁、光子、化学、材料、生物、机器人等12个研究方向、10种领域原生科学环境的论文复现基准,包含3168条专家校验的评分项。
  3. 03评测采用「断网重跑」机制:Agent交卷后系统删除全部输出、切断网络,在隔离环境中从头执行工作流,评分器只认重放产物。
  4. 04在10组受测配置中,建模和执行阶段平均分分别为62.70%和61.84%,但验证阶段平均分仅有42.80%,表明AI难以判断自身产出的科学可靠性。
  5. 05前期决策(论文理解、科学建模、参数选择)的效率决定了后续计算的价值,例如Fable 5模型将37.1%时间用于前期重建与实现,反而能以较少交互取得接近最优的分数。
  6. 06PaperBenchX将论文复现任务拆解为理解科学问题、正确完成科学仿真、判断结果是否可信三个层次,并与已有基准(如OpenAI PaperBench)形成核心区别——后者局限于ML/Python栈。
反方 / 局限
  • — 文章暗示,13.98%的完整复现率虽然很低,但部分进展是真实的,Agent在建模和执行上已取得阶段性成功,差距集中在验证环节。
  • — 文章指出,复现任务无法完全模拟真实科研的「先验不确定性」:真科学发现通常是提新问题,而非验证已知结论。
14 分钟 · 5 卡片 · 7 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问