7.5
深览指数
科技虎嗅·第一新声··AI 生成

OpenAI Astra用2000美元拿下10道世纪难题,数学家的定义被改写了吗?

OpenAI 宣称其下一代模型 Astra 在数学和理论计算机科学领域解决了 10 道长期未解的难题,包括非 sofic 群的存在性构造、Connes 刚性猜想证伪、高维球体堆积问题的突破等。文章一方面列举了具体成果和数学界的反应,另一方面也提出了冷静质疑:Astra 是未发布模型、同行评议尚未完成、Lean 验证不等于证明原创、2000 美元仅是推理成本。核心观点是,Astra 的真正意义不在于“AGI 来了”,而在于它首次将“提出论证、整理验证、机器验证”串成流水线,改变了数学研究的经济学基础。适合对 AI 前沿能力、数学基础问题及技术商业叙事有判断力的读者。原文 ↗

核心观点
  • Astra 的真正意义不在于 AI 即将获得菲尔兹奖,而在于它首次将数学研究中“提出论证、整理论证、机器验证”三件事串成了一条流水线,改变了数学研究的经济学根基——从“证明稀缺”走向“证明过剩”。
  1. 01Astra 解决了 10 道数学难题,包括:非 sofic 群的存在性构造(1999 年 Gromov 提出)、Connes 刚性猜想证伪(1982 年菲尔兹奖得主断言)、高维球体堆积问题(突破了 1978 年以来的 Kabatiansky–Levenshtein 界),以及埃尔德什的三道经典开放问题等。
  2. 02按 OpenAI 的 Sol API 费率折算,寻找全部解法消耗的 Token 总价约 2000 美元,平均一道题 200 美元。
  3. 03Astra 的论证由模型生成,人类负责整理和验证,最终由模型将每一步转化为 Lean 形式化证明(sorry_count 为 0)。
  4. 04顶尖数学家反应强烈:菲尔兹奖得主 Timothy Gowers 表示“如果证明通过同行评议,将需要重新思考‘做数学’意味着什么”;牛津大学 Thomas Bloom 认为整体学术价值远超此前证伪埃尔德什单位距离猜想。
  5. 05Epoch AI 采取了措施确保这些题目未出现在任何公开训练数据中,以证明 Astra 展现的是真正的数学创造力,而非检索能力。
反方 / 局限
  • 认知科学家 Gary Marcus 指出,将数学上的成功外推至通用智能是“合成谬误”。数学适合符号验证和生成合成数据,但不能模拟开放式的世界,也不能保证 AI 避免幻觉和解决可靠性问题。
  • Astra 是未发布的内部模型,OpenAI 展示的是精选后的 10 道题,失败次数未知(例如尝试黎曼猜想未成功)。
  • 同行评议尚未完成,“攻破”和“被数学界正式确认”之间还隔着一个完整的独立复核周期。
  • Lean 验证能保证推导逻辑无漏洞,但无法判断模型是否真正“理解”了题目,也无法评估证明方法的创新性和学科分量。
  • 2000 美元仅是推理成本,未计入数十亿美元的模型训练成本、研发薪资、选题成本等;将证明写成 Lean 文件还花了团队一周时间。
  • OpenAI 优先在华盛顿向政策制定者演示 Astra,其叙事有获取政策信任、避免过度监管的商业意图,技术事实需独立验证。
11 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问