6.9
深览指数
科技微博·机器之心Pro··AI 生成

XYZ最强Search Agent横扫七大榜单,300个Agent跑通AI4AI全栈闭环

XYZ AI Lab 发布了两款 Deep Search Agent(Aquila-mini 和 Aquila-pro),在七项基准测试中取得多项 SOTA 成绩。文章的重点不是模型性能本身,而是其背后的 AI4AI 研发范式:让 AI 在高频实验、失败轨迹分析、方案提出和执行中扮演核心角色,同时将规则制定、评测标准和最终决策权保留给人类。文章详细描述了这一系统的运行机制(任务构造、状态对齐 SFT、运行时审计、门控机制等),并以一个实际案例说明了 AI 如何从失败轨迹中提出人类未预设的改进方案(如主动上下文整理)。本文适合关注前沿 AI 研发范式、Agent 系统设计与自动驾驶科研的从业者阅读。原文 ↗

核心观点
  • XYZ AI Lab 的核心贡献不是模型性能,而是探索了一种有边界的 AI4AI 研发范式:让 AI 驱动系统级改进循环,但将规则制定、评测标准和最终决策权保留给人类。
  • AI 在 AI4AI 循环中,不仅自动化了实验执行,而且能从海量失败轨迹中识别出人类未曾预设的改进方向,扩展了团队实际能够探索的解空间。
  1. 01XYZ-Aquila 在 BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、HLE 和 WideSearch 七项基准中,mini 版本均取得最佳结果,如 BrowseComp 78.8、GAIA 97.1。
  2. 02AI4AI 系统由十余人的核心团队在两个月内建成,协同调度超过 300 个 Agent Workers,在千卡级等效算力支持下运行。
  3. 03系统实现了一个具体案例:AI 从长程搜索轨迹中提出“主动上下文整理”和“研究记事本”两个候选方案,解决了 Agent 找到关键证据但最终答案未使用的问题。
  4. 04Google DeepMind 的 AlphaEvolve 已被用于数据中心效率优化和芯片设计;Anthropic 披露其代码库中超过 80% 的新代码由 Claude 编写;OpenAI 在 GPT-5.6 发布中引入了 RSI Index。
  5. 05系统的运行原则是“人定规则,AI 找路;独立评测,全程留痕”。Agent 的修改必须经过独立评测器和门控机制,当证据冲突或高风险时升级至人类审查。
  6. 06系统采用“状态对齐的监督微调”方法,训练时仅重建模型当时实际可获得的可见状态,仅监督有效推理和工具调用,而非整个成功轨迹。
反方 / 局限
  • 文章承认 XYZ-Aquila-pro 在部分评测集上(如与 Claude Opus、GPT 等大型闭源模型相比)仍有差异,表明其能力上限并非全面领先。
  • AI4AI 系统成功的核心前提是“目标、权限、资源和验收规则均由人类定义”,这限制了其探索的自主性和边界,距离完全自主的 RSI 还有很大距离。
  • 文章对 AI4AI 范式的描述高度理想化,但未提及失败的案例或系统运行中遇到的重大障碍,可能导致对该系统成熟度的过度渲染。
12 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问