7.4
深览指数
科技人人都是产品经理·AI异类弗兰克··AI 生成

AGI 下一堵墙:Agent 自我迭代,这个团队用自进化蜂群破局

本文介绍了EvoMap团队提出的Agent新架构EvoX,核心观点是当前Agent系统的主要瓶颈不在于模型能力,而在于缺乏一个能持续学习、可靠协作的系统架构。文章通过两组内部实验(效率对比实验和自组织网络实验)和6个主流Benchmark的验证,展示了EvoX的蜂群模式——将复杂任务拆解为原子任务,每个Agent独立执行,再通过程序化接口汇合——相比主从式Agent Team模式,能显著降低中间正确结果的丢失率(从55.5%提升至接近100%),同时成本更低。文章还展示了Agent基于任务经验和能力自主选择协作伙伴的自组织雏形。适合对Agent系统架构、Multi-Agent协作、大模型产品化方向感兴趣的从业者和研究者阅读。原文 ↗

核心观点
  • 当前Agent系统的主要瓶颈不是模型智力,而是缺乏一套能在长任务中持续验证、汇合、积累经验的系统架构;EvoX的蜂群模式通过任务原子化、执行隔离、程序化汇合,为这一问题提供了可行解法。
  1. 01在563个任务的内部实验中,Agent Team模式有373个任务过程正确,但最终交付时只保留217个正确,中间正确答案保留率仅为55.5%。
  2. 02在相同模型(Opus 4.8)、相同题库下,EvoX蜂群模式正确率显著高于Agent Team模式和单体Agent模式,差距被拆解为任务拆解粒度、执行隔离度、汇合可靠性三层。
  3. 03在6个主流Benchmark共424个任务中,EvoX与Claude Code、Codex进行了对比,整体通过数相近(338 vs 358 vs 338),但EvoX在AppWorld(87/90)和GAIA(49/51)上表现突出。
  4. 04EvoX每个任务平均成本按统一价目表为6.10美元,按实际缓存计价为1.95美元,在三家中最低,接近Claude Code,明显低于Codex。
  5. 05团队进行了自组织实验:24个相同配置的Agent在执行任务后沉淀经验(Gene),并允许随机打断连接后自主选择新伙伴。结果显示,当系统暴露任务信息(对方专业侧重和正确率)时,Agent的选择逻辑从社交关系转向能力匹配。
  6. 06EvoX蜂群模式的核心机制:将复杂任务拆解成尽可能多的原子任务,每个Agent负责边界明确的局部问题,将答案写到约定位置,最后由程序按约定规则汇合,无需主Agent转述、压缩和取舍。
反方 / 局限
  • 文章承认EvoX目前仍处于beta阶段,在Terminal-Bench 2和Cybench上表现是短板,并且需要进一步验证权限隔离、成本控制、失败恢复、边界任务和长期记忆污染等问题。
12 分钟 · 3 卡片 · 6 资料
读原文 →

前置背景

平行视角

延伸追问