7.2
深览指数
科技微博·机器之心Pro··AI 生成
Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨
新加坡国立大学、普林斯顿大学等团队提出Recuris,一种无需训练即可提升LLM智能体长程任务记忆能力的架构。核心创新在于将记忆拆分为经验记忆与工作记忆,后者持续追踪任务状态,使技能调用从膨胀的上下文中解耦;同时通过结构化轨迹实现组件级失败定位,而非依赖最终成败信号进行粗粒度更新。在多个长程基准和从3B到Claude Opus 5的十种模型上均取得显著提升,且演化出的记忆可跨任务、跨模型迁移。适合关注AI Agent架构、记忆机制与自我改进方向的研究者或工程师阅读。原文 ↗
核心观点
- ▍长程场景下LLM智能体的真正瓶颈并非缺少可用经验,而是缺少一个紧凑、可靠的任务状态(即工作记忆)来持续对齐已积累的经验与当前的执行需求。
- ▍Recuris首次将递归自我改进应用于记忆控制层,通过结构化轨迹实现组件级失败定位与靶向演化,无需训练即可在多种模型上提升性能。
- 01在τ²-Retail、τ²-Airline、SkillFlow、Terminal-Bench 2.1四个长程基准上,Recuris在从3B小模型到Claude Opus 5和GPT-5.6-Sol等前沿模型上均表现出大幅性能提升。
- 02按任务固有长度分位测试,Recuris在全部四个分位上领先基线,幅度为+17.0至+44.7,优势不随任务变长而衰减。
- 03在故障定位实验中,利用结构化轨迹的裁判准确率达到64.8%,远高于只看最终成败(13.0%)和原始轨迹(37.0%),接近随机基线(33.3%)的两倍。
- 04演化出的记忆可在93个任务中迁移:从16个失败任务蒸馏的记忆,在未参与演化的86个任务上仍带来+9.01至+17.44的提升。
- 05跨模型迁移有效:在一份模型上演化出的记忆,直接交给未参与演化的其他前沿模型,同样能产生明显提升。
- 06Recuris的核心架构包括经验记忆-工作记忆耦合、结构化轨迹与组件级失败定位、以及有界验证门控的递归演化。
6 分钟 · 4 卡片 · 8 资料
读原文 →