7.5
深览指数
科技Bestblogs·阿里云开发者··AI 生成

「架构师 Agent」系统化落地

本文系统性地提出了一套让 AI Agent 在大型存量分布式系统中承担架构师职能的实践方法。核心观点是 AI 在该场景下效果不稳定的根源在于知识断裂,而非模型能力不足,因此方案以强结构化分层知识库作为知识骨架,替代传统的 RAG 方式,并通过渐进式披露与 Agent Runtime 设计,使 AI 能独立完成跨系统的技术方案设计,人类则从资料收集者转变为决策裁决者。适合正在探索 AI Agent 落地复杂业务系统、尤其是对知识工程和系统架构有实践经验的读者。原文 ↗

核心观点
  • AI 在大型存量分布式系统中表现不稳定的根源是知识断裂(关键知识散落在代码、文档、配置与经验中),而非模型能力不足,这导致了‘局部正确、整体错误’的问题。
  • 让 AI 成为系统架构师的系统性方案,核心在于用强结构化、按‘领域’分层的知识库替代 RAG 作为知识骨架,并配以渐进式披露的 Agent Runtime 设计。
  1. 01RAG 的核心问题是只能‘找出可能相关内容’,无法保证知识集合的完整性与工程相关性,而固定结构的知识库(如 business-knowledge 下的 meta、principle、scenario 等)能提供‘知识覆盖约束’,给 AI 确定的阅读路径。
  2. 02知识库建设以‘领域’为第一层,采用强结构化设计,包含 business-knowledge 的 meta、principle、scenario、practice、reference 等子域。
  3. 03知识正确性需要维护机制支撑,包括日常增量维护(关联 Git Push、PR、发布)和周期性校准(如大促复盘),高风险知识变更需人工确认语义。
  4. 04技术方案设计 Agent 的核心是渐进式披露:通过分层知识(业务层→架构层→系统层→基建层)按需加载,避免一次性加载所有信息。
  5. 05Agent Runtime 由业务理解层(KBase MCP)、系统分析层(AITOM)、架构推理层(Skill)、服务知识层、事实验证层(Git)构成。
  6. 06人类角色从‘替 AI 收集资料’转变为‘裁决事实缺口与承担关键决策’,AI 在涉及业务取舍、跨团队接口承诺、合规等高危决策时应停止猜测并发起问题。
反方 / 局限
  • 方案依赖的前提是团队有足够的能力与成本投入,去建立和维护高度结构化的、持续更新的知识库,这在很多中小团队或快速变化的业务中可能难以实现。
  • 文章未深入探讨当 AI 决策链条极长、涉及数十个系统依赖时,其推理结果的‘可解释性’和‘回溯纠错’的成本问题,这对实际落地至关重要。
4 分钟 · 4 卡片 · 7 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问