8.3
深览指数
科技Bestblogs·阿里云开发者··AI 生成

从 Prompt 到 Harness:企业级 Agent 工程的完整演进之路

文章基于阿里云内部构建企业级 AI Agent 平台的实战经验,系统梳理了从 Prompt 工程到 Harness 工程的技术演进路径。作者指出大模型存在上下文窗口稀缺、注意力稀释、数据搬运谬误、无状态四个结构性约束,并提出了四层上下文防线、三层记忆架构以及“事前防御优于事后修复”的赋能范式。文中包含大量具体工程细节(如 parameterBindings、step_control、预算预检),对正在或即将搭建高复杂度 Agent 系统的技术决策者具有直接参考价值。原文 ↗

核心观点
  • 大模型有四个结构性约束(上下文窗口稀缺、注意力稀释、数据搬运谬误、无状态),它们不会随模型变大消失,所有工程化努力都必须围绕这些约束构建。
  • Agent 工程的最佳实践是从“防御范式”(修复错误)转向“赋能范式”(消除错误发生的条件),通过声明式绑定、显式表达等机制,让系统做确定性工作,LLM 只做推理。
  1. 01上下文管理需要四层防线:L1 工具结果压缩、L2 语义压缩、L3 对话压缩、L4 数据总线,按数据膨胀的时间顺序逐层拦截,组合覆盖全场景。
  2. 02三层记忆架构(State、Working Memory、Transcript)将 Token 消耗降低 60%以上,使 Agent 在 30 步以上的复杂任务中稳定执行。
  3. 03parameterBindings 声明式绑定机制将数据搬运从 LLM 职责中移除,LLM 的表达从“如何获取数据”变为“我要什么数据”,减少了上下文噪音和幻觉风险。
  4. 04step_control 机制要求开发者显式声明每一步的意图(Write、Control、Continue),避免 LLM 通过自然语言猜测“下一步做什么”,从而提高确定性。
  5. 05单一表示原则规定:同一份上游数据在后续所有 LLM 上下文中只允许出现一种表示形态,防止模型因多种描述产生幻觉或浪费 token 做交叉验证。
  6. 06预算预检机制在调用 LLM 前估算上下文成本,超预算时按固定顺序降级(如丢掉 L4 数据总线、L3 对话压缩),确保复杂任务在有限窗口内可执行。
  7. 07Action Space 动态裁剪根据当前上下文状态和任务进度,自动移除不相关的工具,缩小 LLM 的选择范围,避免注意力被无关选项稀释。
反方 / 局限
  • 作者承认,当模型从 32K 升级到 128K 上下文窗口时,注意力稀释问题不会消失,只是把恶化点从第 5 步推迟到第 8 步,趋势不变。
  • 文章主要基于阿里云内部实践,其提出的架构(如五层 Agent 操作系统)尚未被外部大规模验证,其他团队的工程实践可能有不同的约束和权衡。
4 分钟 · 3 卡片 · 6 资料
读原文 →

前置背景

平行视角

未来推演