7.1
深览指数
科技微博·机器之心Pro··AI 生成

多项Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境

Aether AI 提出 RSIAgent,一种让 AI Agent 在不更新底层模型参数的前提下,通过自主探索新环境来积累经验的框架。其核心是“Scaling Experience”而非“Scaling Model”:依靠课程生成、执行、验证、记忆演化的递归循环,让 Agent 像人一样试错、发现因果规律。在 OSWorld 2.0 和 Agents‘ Last Exam 上,基于 GLM-5.3 等开源模型的 RSIAgent 性能超越了 GPT-6 Astra 等闭源模型。本文适合对 Agent 自我进化、因果智能、以及“后训练”时代模型能力持续提升路径感兴趣的技术研究者阅读。原文 ↗

核心观点
  • RSIAgent 的核心是“Scaling Experience”:在不更新底层模型参数的情况下,让 Agent 通过在新环境中自主探索、试错、验证因果规律,持续积累可复用的经验(Memory),从而实现能力提升。
  • RSIAgent 采用“Broad-to-Deep”两阶段自探索策略,先通过并行广泛探索快速建立环境知识地图,再通过顺序深入探索攻克关键难点和边界案例。
  1. 01在 OSWorld 2.0 基准测试中,基于 GLM-5.3 的 RSIAgent 将 Partial Score 从 71.97% 提升至 78.98%,超越了 GPT-6 Astra 的 72.60%。
  2. 02在 Agents‘ Last Exam (Near-term) 测试中,基于 Kimi-K3 的 RSIAgent 得分达到 84.82%,同样超过了 GPT-6 Astra 的 82.26%。
  3. 03RSIAgent 的泛化能力在 GameCraft-Bench 的自主游戏开发任务中也得到验证,在游戏机制、深度、视觉、艺术和整体质量等维度均有提升。
  4. 04消融实验表明,Broad Recursive Self-exploration(BRS)和 Deep Recursive Self-exploration(DRS)阶段均不可或缺,移除任意一方会显著影响探索的广度或深度。
  5. 05随着 RSI 轮次增加,Agent 性能持续提升,部分初始成功率为 0-40% 的复杂任务经过多轮探索,最终得分可达到 100%。
  6. 06RSIAgent 由 curriculum agent、actor agent 和 verifier agent 三个智能体组成递归闭环,分别负责确定探索方向、执行任务和验证结果。
反方 / 局限
  • 文章未明确提及该方法在计算成本(探索所需的轮次和时间)上的具体开销,以及面对高度动态变化的环境时,积累的经验(Memory)的失效或回退机制。
  • 在需要大量人工先验知识或规则定义的复杂任务中,完全自主探索(curriculum agent生成任务)可能效率低下,需要人工干预或引导。
14 分钟 · 5 卡片 · 7 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问