6.6
深览指数
科技量子位·鹭羽··AI 生成

小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅

小红书大模型dots-note-3.0在IMO 2026中以满分42分获得金牌,成为中国首个获得IMO官方金牌水平认证的大模型,也是全球第二个达到此成绩的模型(此前谷歌Gemini为5/6题)。文章重点介绍了模型用自然语言端到端推理、在第三题中以归纳法取代常规图论解法、以及Agentic推理系统稳定性等能力。本文适合关注大模型基础能力、推理评测、以及中国AI竞赛表现的读者阅读。原文 ↗

核心观点
  • 小红书大模型dots-note-3.0在IMO 2026中以满分42分获得金牌,证明其具备可迁移的通用推理能力,进入值得行业认真审视的基础模型玩家行列。
  • 模型在第三题(组合博弈)中采用了归纳法替代常规的图论转化解法,被CMO金牌得主评价为「结构紧凑、逻辑自然、直击本质」。
  1. 012026年IMO金牌线为29分,去年为35分,下降6分;小红书模型满分42分,比金牌线高出13分。
  2. 02模型仅用自然语言端到端完成读题、解析、写证明全过程,无需先翻译成Lean等形式化语言。
  3. 03推理过程中智能体使用自然语言结合Python代码执行,并借助递归自我批判能力审视自身论证。
  4. 04模型在当届IMO严格流程下测试:每比赛日结束后才收到题目,须在规定期限内提交PDF答卷,由多国评审员按正式标准审阅。
  5. 05双CMO金牌得主刘涵祚评价:「模型最终给出了一条正确且漂亮的证明思路……即使放在IMO解答中,也属于较为简洁优雅的一类。」
  6. 06CMO金牌得主汪千桐评价:「dots直接攻克了题目最难、也最本质的部分……看完以后,会觉得每一步都顺理成章,但人类选手很难想到。」
  7. 07同日,Fable 5大模型参与构造了一个雅可比猜想反例,该猜想自1939年提出以来悬而未决87年。
反方 / 局限
  • 文章未提及模型推理过程中的失败案例或计算/能源成本,也未说明模型在人机协作评测中的局限性(如对特殊符号或长文本的依赖)。
10 分钟 · 5 卡片 · 13 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问