科技Bestblogs·ByteByteGo··AI 生成
ChatGPT 如何优化其智能体循环:编排层、API 与推理层
本文以 OpenAI 的 Codex 和 ChatGPT 为例,详细拆解了 AI 智能体应用的架构,将其分为编排层、API 层和推理层。文章通过具体的技术方案(如持久化 WebSocket、增量请求、稳定提示词前缀、缓存感知路由和推测解码),展示了如何在不同层面消除重复计算和通信开销,从而降低每次任务的成功成本。对于关注 LLM 工程落地、性能优化和系统架构的读者,本文提供了可迁移的工程原则和具体实现思路。原文 ↗原文 ↗
核心观点
- ▍提升 AI 智能体效率的核心在于建立分层架构(编排层、API 层、推理层),并在每一层针对性地消除重复的工作和通信开销。
- 01编排层:使用持久化 WebSocket 避免每次调用的 HTTPS 连接建立成本。
- 02编排层:通过增量请求,只发送新产生的工具结果,并引用之前的响应,以消除负载重复。
- 03编排层:通过稳定提示词前缀(如固定系统提示词、工具定义顺序)来最大化推理层的 KV 缓存命中率。
- 04编排层:采用延迟工具发现,仅在需要时加载工具架构,避免提示词被不必要地膨胀。
- 05编排层:代码模式(Code Mode)允许模型一次性输出多个工具调用,从而将多次模型往返合并为一次。
- 06API 层:仅对增量部分进行分词,并与安全检查进行并行处理,以降低延迟。
- 07推理层:采用缓存感知路由,将请求路由到已缓存了相关 KV 状态的 GPU 节点。
- 08推理层:使用推测解码和将预填充与解码分离的技术来加速推理过程。
反方 / 局限
- — 文章所描述的优化技术(如缓存、推测解码)高度依赖于特定的硬件条件(如 GPU 集群)和模型架构,对于使用较小模型或不同推理后端的团队,部分技术的实现复杂度和收益可能不同。
概念锚点
前置背景
未来推演
延伸追问