8.2
深览指数
科技微博·机器之心Pro··AI 生成
AI会做题,却未必能自进化:字节Seed等提出三项新基准
文章指出当前 AI Agent 自我改进的真正瓶颈不再是“能不能改”,而是“该改什么、什么经验值得吸收”。字节跳动 Seed 等机构提出三项基准(ASPIRE、S³Gym、HarnessDev),分别研究 Agent 从模糊目标中自主确定学习内容、从自身行为中判断并提取有效经验、以及将系统级修改持久化保留。实验表明,Agent 在自我判断与学习收益、局部反馈与真实目标之间存在严重错配,过度拟合可见指标,导致长期改进难以沉淀。适合对 AI 前沿研究、特别是 Agent 自我进化技术路线感兴趣的读者,可在了解基础 LLM 和强化学习概念后阅读。原文 ↗
核心观点
- ▍当前AI Agent的真正瓶颈不在于能否自我修改,而在于能否准确判断“该改什么、什么经验值得吸收,以及改完之后是否真的变得更好”。
- 01ASPIRE基准中,Agent面对‘提高数学推理能力’等模糊目标时,会花费更多时间解释目标和选择代理指标,留给实际训练和评测的时间更少;30个单元中仅1个增益被最终保留。
- 02S³Gym实验发现,Agent“知道自己做得好不好”的能力很弱:自我判断的准确程度与后续收益的关联很弱,能判断行动好坏却未必能据此调整下一步行动。
- 03S³Gym进一步表明,经验没有通用的保存方式:原始历史与摘要记忆各有优势,同一种方法换个环境就可能失效;更新模型参数可能损害原有能力。
- 04HarnessDev实验让Agent持续自我修改,发现Agent容易过拟合自己的反馈:选定版本在可见反馈上改善,但隐藏测试任务表现却下降。
- 05HarnessDev实验中,Agent的系统修改(如消息清理、上下文压缩)曾破坏合法工具消息序列,导致部分修改被回滚。
反方 / 局限
- — 文章承认,S³Gym实验中观察到了不同游戏间训练收益的差异(如信任博弈收益、植物大战僵尸退步),但尚未确定退步的唯一原因。
- — HarnessDev的演化观察主要来自代码任务,隐藏评测仅覆盖SWE-Pro,各配置为单条轨迹,尚不足以判断长期收益是否稳定。
7 分钟 · 3 卡片 · 6 资料
读原文 →