7.2
深览指数
科技虎嗅·数字生命卡兹克©··AI 生成

Claude Opus5深夜发布,以一半价格逼近Fable5。

作者以一个AI产品开发者的视角,第一时间评测了Anthropic发布的Claude Opus 5模型。文章核心结论是:Opus 5在工程任务、Agent任务、真实任务执行方面已逼近甚至部分超越顶级模型Fable 5,但价格仅为后者一半,是当前最适合大规模“干活”的Claude模型。但作者也指出,Fable 5在纯方案设计、规划、专业推理上仍独占鳌头,Opus 5更像“RL版本之子”。文章还分享了Anthropic在Claude 5时代简化System Prompt的思路,以及作者当前多模型协作的工作流。适合对AI模型能力边界、工程落地有实际需求的开发者/产品经理阅读。原文 ↗

核心观点
  • Claude Opus 5在工程和Agent任务上已逼近Fable 5,但价格只有一半,是当前最适合大规模“干活”的Claude模型;而Fable 5在方案设计、规划等纯推理任务上仍有优势,并未被完全取代。
  1. 01Opus 5在ARC-AGI-3(抽象推理与泛化)测试中得分30.2%,远高于GPT-5.6 Sol的7.8%和Opus 4.8的1.5%,甚至接近Fable 5未公布的该测试水平。
  2. 02Opus 5在AA(AA可能是某个特定Agent能力基准测试)跑分上超过了Fable 5。
  3. 03Opus 5定价与Opus 4.8一致:输入每百万Token 5美元,输出每百万Token 25美元,仅为Fable 5价格的一半。
  4. 04作者实测发现,Opus 5能发现GPT-5.6 Sol和Kimi K3代码Review中漏掉的严重BUG(如“击穿边缘缓存”的安全漏洞),证实其任务执行和审查能力更强。
  5. 05Anthropic为Opus 5和Fable 5将Claude Code的System Prompt删减了80%以上,发现编码评测无下降,并提出“从手册制到设计Harness”的转变。
反方 / 局限
  • Fable 5在方案设计、规划、专业医疗表达、高难编程、网络安全等极难专业任务上依然优于Opus 5,后者目前并非全场景超越。
  • 作者指出,模型厂商发布的评测集存在误导性,主要侧重代码、Agent、办公等场景,而Opus 5在非工具推理、原生视觉理解等方面的能力仍需系统卡对比数据才能看清全貌。
  • 对于写作任务,作者认为Claude Opus 4.6仍然是最好用的,Opus 5并未延续其优势。
16 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问