7.8
深览指数
科技Bestblogs·腾讯技术工程··AI 生成
错误码排查从 3~8 小时到分钟级,Agent 怎么做到的?
腾讯 SRE 团队分享了基于单 Agent 挂载四类能力(知识库、代码关系图谱、可观测平台、代码托管)构建的错误码治理 Agent 实践。核心挑战并非告警量多,而是证据分散在系统、代码、日志、Trace 中,人工排查一个错误码需 3-8 小时。文章详细描述了 Agent 的架构选型、多源证据交叉验证的置信度体系、稳定输出契约的 11 节点工作流设计,以及基于 50 条 case 进行案例驱动、规则显式化、而非堆砌提示词的 5 轮 Prompt 调优过程。最终 action_type 与人工标注一致率从 66% 提升至 88%。文章对内部工程细节(如批处理限频、分支变量统一)坦率陈述,适合对 AI Agent / SRE 落地有实操经验的读者。原文 ↗
核心观点
- ▍错误码治理的核心难点是证据分散,而非告警数量本身,根源需跨知识库、代码、日志与 Trace 四个系统定位。
- ▍单 Agent 挂载全部能力优于多 Agent 协作,因为排查是渐进式探索任务,后续步骤依赖前一步结果,多 Agent 的通信与上下文传递成本较高。
- 01人工排查单个错误码耗时 3~8 小时,且转给开发后往往还要再查一遍。
- 02方案选择单 Agent,工作流负责入参预处理与结果组装,Agent 负责自主排查并输出 JSON,Skill 承载排查流程与规则。
- 03多源证据交叉验证的置信度模型:知识库、代码定位、实际源码、运行时证据各计 1 分;代码托管平台变更信息不计分,因为代码怎么写不等于现场怎么跑。
- 04稳定输出依赖 11 节点工作流与快慢双路径解析:快路径四层容错解析加慢路径 LLM 提取 9 个字段兜底;Skill 侧输出前执行 17 项检查。
- 055 轮 Prompt 调优基于 v3 与 v4 的 50 条 case 对比,采用案例驱动、规则显式化策略,如将加白判断改为先排除禁止场景再判断,并为修复建议划定三条边界。
- 06效果:action_type 与人工标注一致率从 66% 提升到 88%,需人工介入率从 34% 降至 12%,硬冲突率从 20% 降至 0%。High 置信度约 90%,失败率约 1%。
反方 / 局限
- — 作者明确指出 50 条样本同时用于调优与回归,不代表泛化效果,可复用的是方法而非整套规则。
5 分钟 · 3 卡片 · 5 资料
读原文 →