7.2
深览指数
科技TechCrunch·Tim Fernholz··AI 生成
OpenAI 的数学解题方案尚未达到领域标准
OpenAI 近期发布了数百道顶级数学难题的解题方案,并宣称已遵循数学家咨询委员会的指南以避免争议。然而,该委员会指出,OpenAI 并未完全遵循其核心建议,包括停止在专有模型上测试高级数学问题,以及确保人类对结果的理解。更关键的是,一篇新论文揭示了 OpenAI 为解决纳维-斯托克斯问题提供的自然语言证明与其形式化 Lean 代码之间存在「翻译偏差」,动摇了人们完全信赖 AI 自动证明的基础。对于密切关注 AI 在科研领域应用前景、以及数学共同体与科技公司博弈的读者,本文提供了具有警示意义的深度报道。原文 ↗
核心观点
- ▍OpenAI 在发布数学解题方案时,未能遵循数学家咨询委员会(AGMAI)关于确保人类理解的核心指南,其方案存在自然语言与形式化证明之间的翻译偏差,该领域的标准尚未达到。
- 01AGMAI 的第一条建议是「停止在专有模型上测试高级数学问题」,但 OpenAI 的发布明确表示其在用未解决的数学研究问题评估其专有模型。
- 02在 OpenAI 发布的 719 份解题手稿中,仅有 10 份(约 1.4%)包含了模型的思维链(chain of thought)输出。
- 03数学家建议未被人理解的证明应当进行形式化,但 OpenAI 发布的证明中有 42% 未经过这一 Lean 代码形式化过程。
- 04剑桥大学和伦敦国王学院的数学家发表论文,指出 OpenAI 针对纳维-斯托克斯方程(Navier-Stokes)衍生问题的证明中,自然语言与 Lean 代码之间存在至少两处「翻译偏差」,质疑能否在无人参与的情况下完全信赖模型自行形式化其解决方案。
- 05著名数学家陶哲轩(Terence Tao)批评称,AI 解题者对整个领域毫无兴趣,一旦「解决」初始目标便不再关心,无法回答问题、做报告或与领域同行互动。
- 06哈佛大学数学教授梅兰妮·伍德(Melanie Wood)指出,AI 解决方案在发布时没有人类理解,「工作才刚刚开始」,强调了人类后续解译和验证的必要性。
反方 / 局限
- — 自然语言与形式化证明之间的偏差「不一定推翻任何一种解决方案」,意味着问题可能根植于翻译过程而非证明本身的数学正确性,这为 AI 的可用性留下了一丝理论上的可能性。
- — OpenAI 确实部分遵循了 AGMAI 的部分指南,例如尽快发布结果、包含模型推理过程信息,这说明双方并非完全对立,存在协作空间。
OpenAIAGMAI (Advisory Group on Mathematics and Artificial Intelligence)普林斯顿高等研究院剑桥大学伦敦国王学院陶哲轩 (Terence Tao)梅兰妮·伍德 (Melanie Wood)蒂姆·费恩霍尔茨 (Tim Fernholz)Lean纳维-斯托克斯方程自然语言证明形式化证明思维链 (Chain of Thought)
12 分钟 · 5 卡片 · 14 资料
读原文 →