8.0
深览指数
科技人人都是产品经理·易安说AI··AI 生成
Claude Opus 5实测:提示词不改,Token白烧
文章核心观点是,Claude Opus 5的能力虽强,但行为特征(更主动、更爱话多、更喜欢召唤子智能体)与旧模型有显著差异,沿用旧提示词和Agent调度策略会导致Token浪费和任务边界混乱。作者提出了一份具体的迁移指南,包括如何改写提示词(避免泛泛的“仔细检查”,改为具体验收条件)、如何配置effort、如何限制子Agent、如何在视觉任务中引入工具闭环。适合正在或计划将Opus 5接入开发流程的工程师和团队阅读,可将其视为一份工程实务备忘录。原文 ↗
核心观点
- ▍Claude Opus 5 默认行为已变,开发者若沿用旧模型的提示词和Agent调度策略,会导致Token浪费和任务边界混乱,需要一份针对性的迁移指南。
- 01Opus 5 在Frontier-Bench、CursorBench 3.2、ARC-AGI 3、Zapier自动化测试、OSWorld 2.0等多项评测中,以更低成本实现了接近甚至超越旗舰模型(如Fable 5)的性能。
- 02在提示词结尾加“请仔细检查”会触发Opus 5的过度验证,导致重复读文件、反复自我质疑和扩展任务范围,将小修改变成高成本长任务。
- 03Opus 5在代码审查上更精准,但若要求其“保守”会漏报真实Bug;更优策略是先高召回报告所有问题,再按严重性分级,最后人工过滤。
- 04Opus 5对图表理解和前端视觉复刻能力增强,应引入截图对比、像素检查等视觉验证工具形成闭环,而非仅靠语言描述。
- 05Opus 5喜欢召唤子智能体,但在单文件小修等简单任务上会不必要地拆分任务,导致成本翻倍,需要制度性规则限制子Agent使用。
- 06新版API允许对话中途更改工具而不使缓存失效,并加入了自动回退机制,但要求工程团队必须记录实际处理请求的模型、effort和是否触发回退,否则复盘困难。
反方 / 局限
- — 文章承认,Opus 5在编程和高频任务上优势明显,但Fable 5仍可能更适合部分通用复杂任务,建议团队用自己的任务集做A/B测试,不应仅凭跑分替换。
- — 文章指出,Opus 5的自动回退机制虽能避免请求被阻断,但会显著增加复盘难度,当请求被不同模型处理后,结果不一致的原因难以定位。
9 分钟 · 4 卡片 · 9 资料
读原文 →