7.5
深览指数
科技人人都是产品经理·易安说AI··AI 生成
Opus 5上线后跑分爆了,Claude Code该减负了
文章认为,Claude Opus 5 的真正价值不是跑分超越 Fable 5,而是在代码执行、工具调用和错误发现等工程任务上表现出更强的“执行 Agent”能力。作者通过一个真实案例(Opus 5 发现多模型审查未察觉的缓存击穿风险)论证了强模型时代需要的工作流变革:从给模型叠加大量规则和提示词(手册制),转向设计让模型能自主判断、执行、反馈和纠错的工程环境(Agent Harness)。核心结论是,Claude Code 应大幅删减冗余规则,将约束内化到工具和环境中。适合一线开发者、AI 应用架构师和团队技术负责人阅读。原文 ↗
核心观点
- ▍Opus 5 的核心价值不是跑分,而是作为更成熟的“执行 Agent”,擅长代码执行、工具调用、结果检查和错误修复,其泛化能力正从评测走向生产力。
- ▍在强模型时代,给 Claude Code 等工具塞入大量规则和提示词已成为负担,工作流应从“手册制”转向“Agent Harness”,即通过环境、工具和反馈来控制风险,而非靠规则绑死模型。
- 01Opus 5 在 ARC-AGI-3 评测上达到 30.2%,远高于 GPT-5.6 Sol 的 7.8% 和 Opus 4.8 的 1.5%,表明其在陌生任务上的抽象推理和动态适应能力有显著提升。
- 02一个真实案例:某 AI 资讯产品重构后,经 GPT-5.6 Sol、Kimi K3、Opus 4.8 多模型审查均未发现问题,但 Opus 5 单独审查时发现了一个边缘缓存击穿风险,该风险曾导致流量被攻击打爆和账单崩坏。
- 03Anthropic 在 Claude 5 时代将 Claude Code 的 System Prompt 删掉 80% 以上,且编码评测未出现可测量的下降,表明模型已无需过多提示词来“扶住”。
- 04Opus 5 具备 100 万上下文,知识截止到 2026 年 5 月,价格延续 Opus 4.8 的输入 5 美元/百万 Token、输出 25 美元/百万 Token,Fast Mode 速度提升约 2.5 倍但价格翻倍。
- 05文章给出了一个模型路由建议:Fable 5 适合大规划,Opus 5 适合常规方案设计和 Review,Codex + GPT-5.6 Sol 适合长时间无人值守任务。
反方 / 局限
- — 文章承认,Opus 5 并未取代 Fable 5,Fable 5 仍在大体量规划、无工具推理和高难专业任务上占据优势,两者是分工而非替代关系。
- — 作者指出,模型 Review 能扩大覆盖面,但不能完全替代人工审查,尤其是缓存、权限、账单、生产数据等风险点,仍需人工确认和测试。
9 分钟 · 4 卡片 · 10 资料
读原文 →