7.7
深览指数
科技微博·机器之心Pro··AI 生成

迈向长程智能体,人大高瓴发布149页全景综述

这篇综述系统梳理了超过900项研究,提出长程智能体能力是'外部脚手架工程'与'内部模型优化'协同演化的系统级能力,而非模型单点性能。核心贡献在于:将碎片化研究纳入统一框架,定义了H1-H3任务层级与C1-C3能力层级,并从Harness工程(六个核心组件)和模型优化(七类训练方向)两条路径给出完整技术路线图。适合对AI Agent架构、系统工程与前沿研究有基础了解的读者,作为该领域的系统性入局参考。原文 ↗

核心观点
  • 长程智能体能力是系统级能力,源于外部'脚手架工程(Harness Engineering)'与内部'模型优化(Model Optimization)'的协同演进,而非基础模型的一项孤立指标。
  • 长程任务的核心难点不在于单步准确率,而在于目标漂移、误差累积、上下文腐化、稀疏延迟奖励与不可逆行动等长链条特有的问题。
  1. 01METR测量显示,在约50%成功率下,前沿智能体完成软件工程任务的'人类专家等效时长'已从秒级提升到十余小时,翻倍周期从7个月缩短至约4个月。
  2. 02论文提出H1-H3三层任务框架:窗口内任务、跨窗口/跨会话任务、跨任务流,以及对应的C1-C3能力层级:交互式推理、状态与记忆、经验积累。
  3. 03Agent系统演进分为三个阶段:Prompt Engineering(2020-2023)、Context Engineering(2023-2025)、Runtime Harness(2025至今),控制面从输入文本扩展到运行脚手架。
  4. 04Harness被拆解为六个核心组件:循环与工作流、上下文与记忆、工具/MCP与技能、编排、Hooks与中间件、验证,覆盖从目标设定到最终交付的完整生命周期。
  5. 05模型内部优化路径涵盖七类方向:架构底座、任务/环境/轨迹合成、预训练与中期训练、微调、智能体强化学习、On-Policy蒸馏、自进化。
  6. 06按与环境交互接口,实践形态归纳为五类:软件工程、信息检索、计算机操作、多模态智能体、通用智能体。
反方 / 局限
  • 论文指出,当前研究的限速因素可能不再只是模型规模,而是真实交互环境的构建——构建既可验证又足够真实的训练环境是下一阶段的关键瓶颈。
  • 论文承认,生产环境中的安全与权限边界主要落在Harness而非模型权重中,模型侧对齐必要但不充分,这暗示了纯模型优化路径的局限性。
12 分钟 · 6 卡片 · 17 资料
读原文 →

概念锚点

前置背景

技术原理

平行视角

未来推演

延伸追问