7.7
深览指数
科技Bestblogs·腾讯云开发者··AI 生成

Token 降本 50%:Harness 工作流的成本优化实践

腾讯云开发者团队基于自家 AI Agent 框架 Harness,分享了将单轮会话 token 消耗降低 38.4%、全流程成本降低 50%-65% 的十项具体优化措施。核心技术思路是围绕‘让 AI 只看当前需要的上下文’这一原则,通过渐进式内容加载、确定性操作脚本化、架构拆分、缓存利用等手段,减少大模型在无关或重复上下文上的浪费。文章提供了可复用的检查清单与落地优先级,面向有一定 AI Agent 开发经验、需要系统性地降低 LLM 调用成本的工程师。原文 ↗

核心观点
  • 降低 AI Agent 工作流 token 成本的核心原则是‘让 AI 只看到当前需要的上下文’,而非一味压缩 Prompt 或更换模型。
  1. 01文章提出十项具体优化措施,包括渐进式披露(将条件性内容外移至 references,使初始加载从数千 token 降至 1000-2000 token)、确定性操作脚本化(CLI 替代 MCP,使测试/视觉 Agent 成本降低 64%)等。
  2. 02引入 INDEX.md 目录索引,按需加载历史文档,而非重复载入,使单轮会话 input token 从 1,030,000 降至 634,905(-38.4%)。
  3. 03将单 Agent 拆分为多角色子 Agent,并为每个子 Agent 配置工具白名单,减少无关工具 Schema 常驻 context,并可按角色对模型进行分层,如将测试/视觉等角色切换至低成本模型(如 GLM-5v)。
  4. 04通过使用代码图谱(graphify)减少文件探索轮次,总 token 节省 22.7%;设计稳定前缀以利用 KV Cache,使派发子 Agent 的提示词命中 Prompt Cache,费用降至正常价格的约 10%。
  5. 05无依赖的工具调用并行发起,如同时获取 TAPD 与 Figma 摘要,省去一轮历史打包。
反方 / 局限
  • 文中未提及这些优化措施对 Agent 最终输出质量(如代码生成准确率、任务完成率)的量化影响,仅以 token 成本作为主要衡量指标。
  • 优化措施(如子 Agent 化、代码图谱构建)本身需要前期投入开发和维护成本,文章未量化这部分投入与后期节省的 token 成本之间的平衡点。
  • “稳定前缀”设计高度依赖特定模型(如 GLM、Claude)的 Prompt Cache 机制,若模型 API 不支持或缓存命中率不稳定,该优化效果可能大打折扣。
5 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

技术原理

延伸追问