7.8
深览指数
科技Bestblogs·腾讯技术工程··AI 生成

别再只卷 Prompt 了,真正拉开 Agent 差距的是 Context Engineering

本文系统论述了 AI Agent 开发的重心已从 Prompt Engineering 演进到 Context Engineering(上下文工程),核心观点是:管理 Agent 全生命周期的上下文信息空间,远比优化单次 Prompt 更能决定性能。文章结合 Anthropic 定义、CoALA 记忆框架与 Lost in the Middle 等实证研究,论证了上下文窗口的物理约束(位置、长度、计算量),并给出 System Prompt 的 Goldilocks Zone、State/History 的压缩与外部化策略等具体设计原则。适合有 LLM 开发经验、正在搭建生产级 Agent 的技术人员阅读,可作为工程化上下文管理的实操指南。原文 ↗

核心观点
  • AI Agent 开发的范式已演进至 Context Engineering(2025 至今),它是 Prompt Engineering 和 ReAct 的叠加与升华,核心在于显式工程化地管理 Agent 完整生命周期内的信息空间。
  • 「上下文窗口越大越好」是错误直觉。研究证明,信息堆砌会因位置偏差(Lost in the Middle)、信息衰减(Context Rot)和计算成本(Attention Budget)主动损害性能,最优上下文 = 最小 Token 数量 × 最高信噪比。
  1. 01Lost in the Middle 研究显示,当答案文档位于输入中间位置时,LLM 正确率仅约 35%,低于 56.1% 的闭卷基线,呈现 U 型曲线。
  2. 02Context Rot 现象表明,随着上下文 Token 增加,模型的召回能力呈线性下降,无关 token 并非中性,而是抢占注意力预算。
  3. 03Attention Budget 指出,自注意力机制的计算复杂度为 O(n²),Token 数量翻倍会导致计算、延迟和成本的三重增长。
  4. 04System Prompt 的 Goldilocks Zone 设计:不应写 180 条脆性规则(维护成本高、泛化差),也不应写模糊指令,而应提供「角色/核心原则/工具使用原则」分区结构及高风险行为边界。
  5. 05State/History 是上下文增长最快、Context Rot 的主要来源。生产级 Agent 通常组合使用滑动窗口、Compaction(LLM 摘要)和 Structured Note-Taking(信息外部化)三种策略。以一个代码重构 Agent 为例,到第 35 轮累计约 90,000 Token。
  6. 06长期记忆与检索信息不应全量预加载,应按需检索、精准注入。少样本示例应精简至 2-5 个,并优先覆盖易混淆场景以起到消歧作用。
反方 / 局限
  • 文章虽推崇 Context Engineering 范式,但承认其仍在早期探索阶段,业界对于怎样的信息注入策略协议才算「最优」尚未形成共识,各组件(如结构化笔记)的实现方案也千差万别。
  • 文中推荐的「Structured Note-Taking」策略(将信息卸载到上下文之外)虽理论上支持无限长任务,但引入的外部存储自身的读/写性能、一致性和检索准确性可能成为新的瓶颈,文章未对此展开讨论。
6 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

延伸追问