6.9
深览指数
产品人人都是产品经理·产品包工头··AI 生成
Agent工具调用,PM该管什么
文章明确提出,Agent工具调用的质量60%由设计阶段决定,而非推理阶段。作者从产品经理(PM)视角出发,围绕工具颗粒度、工具描述和失败处理三个核心决策点,给出了具体的决策原则、评判标准和操作动作。文中用实战案例对比了粗粒度与细粒度工具的设计陷阱,强调了工具描述中“不适用场景”的关键性,并指出软失败是导致Agent失控的根源。适合正在设计或优化Agent产品的PM、AI产品经理阅读,能提供可直接落地的设计评审清单。原文 ↗
核心观点
- ▍Agent工具调用的质量,60%由设计阶段决定,而非推理阶段,PM必须主导工具设计而非仅依赖工程师。
- 01工具颗粒度过粗(如一个processOrder()包含校验、扣库存、发消息、写日志)会导致出错后无法定位和重试局部步骤。
- 02工具颗粒度过细会导致Agent完成一个任务需调用十几个工具,研究显示调用超过8次后主流模型任务完成率下降20%以上。
- 03正确的颗粒度原则是:一个工具完成一个原子操作,结果可验证,副作用可预期。检验标准是Agent能否独立判断该工具的结果是否符合预期。
- 04工具描述直接影响模型的选择决策。好的描述应包含四个要素:做什么、适用场景、不适用场景、返回值的结构和含义。
- 05将search_contract的描述从‘搜索合同’改为包含四要素的详细描述后,工具调用准确率通常能提升30-40%。
- 06工具调用失败分硬失败、软失败、幻觉调用三类。PM最易忽视软失败:工具返回空结果时,模型常继续推理并编造答案。
- 07解决方案是为每个工具设计明确的失败语义,包括增加success boolean和reason字段,空结果返回带原因的失败对象而非空列表。
反方 / 局限
- — 文章主要聚焦于PM能控制的工具设计层面,但未深入讨论模型本身的能力瓶颈(如上下文窗口长度、推理稳定性)对工具调用的根本性影响,以及更复杂的工具选择策略(如基于强化学习的动态选择)对设计原则的颠覆。
6 分钟 · 3 卡片 · 8 资料
读原文 →