7.9
深览指数
科技微博·机器之心Pro··AI 生成

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

清华大学与华为提出 HiSME 框架,让 Agent 在执行任务后,不仅能从轨迹中沉淀技能(skill),还能让「产生和修改技能的算法」本身也在测试时持续演化(meta-skill)。该框架在 BFCL-v3 和 MineDojo 上取得稳定收益,并证明了元技能的可迁移性。对于关注 Agent 长程部署、测试时学习、以及 LLM 系统自动工程化的研究者,这是一篇值得细读的技术方案。原文 ↗

核心观点
  • HiSME 的核心观点是:Agent 的测试时学习不应只停留在技能(skill)层面,技能演化算法本身也可以「被演化」,即通过元技能(meta-skill)来优化技能生成、修订和过滤的流程。
  1. 01HiSME 将系统分为三层:轨迹(trajectory)、技能(skill)和元技能(meta-skill)。元技能本质上是针对算法角色的 rules-of-thumb prompts,例如指导 extractor 不要仅凭表层情绪词抽取 workflow。
  2. 02对技能的评价主要关注两个维度:有效性(提供了 Agent 后是否提升后续轨迹效用)和复用性(是否被频繁检索调用)。
  3. 03在 BFCL-v3 multi-turn base 和 MineDojo 基准上,HiSME 相比无技能基线、静态技能演化方法(SkillX)以及 AWM、Memento 等测试时学习基线,均取得稳定优势。
  4. 04消融实验显示,refactorer(从多条轨迹中抽象共享结构)是关键组件,而 extractor、refiner 和 credit filter 共同构成了技能生成与维护的闭环。
  5. 05Meta-test 实验表明,将一次 HiSME 运行中学到的元技能冻结,作为新一轮静态技能演化的初始化规则,其效果显著优于从零开始的静态演化,并接近完整 HiSME,说明元技能具有迁移性。
  6. 06HiSME 的轻量之处在于:将元经验以简单的文本规则维护,并作为上下文指导后续演化,无需更新底层 LLM 参数。
反方 / 局限
  • 文章未系统讨论元技能演化可能带来的系统性偏差放大风险(例如,元技能本身固化错误策略,导致后续演化陷入局部最优)。
  • 实验主要在 BFCL 和 MineDojo 两个场景进行,对于更复杂的现实世界工具调用或开放环境,HiSME 的转化成本与稳定性尚未验证。
7 分钟 · 3 卡片 · 3 资料
读原文 →

前置背景

平行视角

延伸追问