7.3
深览指数
科技微博·机器之心Pro··AI 生成

AIBuildAI开源递归自进化PostTrain Agent,登顶PostTrainBench

AIBuildAI 团队开源了 PostTrain Agent,一个能在给定基座模型、目标能力和算力预算后,自主设计后训练算法、收集数据、写代码、跑实验并迭代改进的递归自我改进(RSI)Agent。在 ICML 2026 提出的 PostTrainBench 基准上,它以 46.6 的综合得分排名第一,超过所有前沿模型与 Agent 系统(包括运行更强底层模型的 Claude Code),距人类专家基线仅差 4.5 分。其关键创新在于引入了“知识系统”和“元搜索”机制,让 Agent 依据可靠知识与动态规划的搜索拓扑做决策,而非仅凭模型内参。本文适合关注 AI 研发自动化、大模型后训练、Agent 系统设计的技术从业者与研究者阅读。原文 ↗

核心观点
  • ▍AIBuildAI PostTrain Agent 表明,大模型后训练正在从“由人类专家操作工具”迈向“由AI自主完成研发闭环”,其能力上限不取决于底层模型,更取决于系统能否利用知识系统进行决策和设计适合任务的搜索结构。
  1. 01在 PostTrainBench (ICML 2026) 上,PostTrain Agent 综合得分为 46.6,高于所有前沿模型和 Agent 条目,包括运行更强模型 Claude Fable 5 的 Claude Code (41.8) 和 GPT-5.6 (36.2),仅次于人类专家基线 51.1。
  2. 02与使用相同底层模型 Claude Opus 5 的 Claude Code (35.0) 相比,AIBuildAI 在七项任务中六项领先、一项持平,相差 11.6 分。知识系统与元搜索带来的增益,超过将底层模型升级一代带来的增益。
  3. 03知识系统包含四个子库:工作流 (13 个有序步骤)、方法 (111 份文件,如 SFT、DPO、GRPO)、数据集 (215 份文件,标注许可证与评测集隔离)、框架 (108 份文件)。每份知识文件来自公开来源,经人工确认与代码实测,每条声明带 URL 与日期。
  4. 04元搜索:元 Agent 调研任务后,从 37 种带可运行示例的搜索模式中组合出搜索程序。程序可包含 Agent、Program、Search 三种基本单元,其拓扑是 Agent 的输出,可动态生成下一阶段,而非在运行前固定。
  5. 05BFCL (函数调用) 任务上,AIBuildAI 在四个基座模型上得分均不低于 94,平均 95.8,是七项任务中唯一超过人类参考 (85.0) 的一项。而同样运行 Opus 5 的 Claude Code 平均仅有 1.5 分。
  6. 06在 AIME 2025(权重最大项)上,AIBuildAI 在每个基座模型上都取得了 Agent 最高或并列最高分,包括最难的 gemma-3-4b-pt (3.3 分,其他 Agent 均不超过 1.1)。其使用的“采样—验证—重训”循环正是元搜索的典型应用。
  7. 07HealthBench × Qwen3-4B-Base 案例中,Agent 先后使用教师模型生成约 4.8 万条回复(SFT 得 46.2 分)与约 6,800 段多轮对话(续训后得 48.6 分),过程中全程依据实测结果决策下一步。
  8. 08AIME 2025 × Qwen3-1.7B-Base 案例中,元 Agent 调研后判断格式非瓶颈,写出了一个五阶段搜索程序(共 471 行 Python、8 个文件),涵盖并行构建多长度语料、小预算试训、策略 Agent 决策主训练方案等环节。
反方 / 局限
  • — 文章未主动讨论系统在“知识系统依赖人工初始化与维护”“多轮实验的累积成本”“更复杂任务下的搜索空间爆炸”等方面的局限或潜在失败案例,也缺少与并行多实验、基于模型性能的提前终止策略等替代方案的对比。
17 分钟 · 5 卡片 · 11 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问