6.4
深览指数
科技腾讯新闻·爱范儿··AI 生成

刚刚,Claude Opus 5发布,半价追平Fable 5

Anthropic 发布 Claude Opus 5,主打“半价旗舰”策略:性能在多项基准测试中逼近甚至超越旗舰模型 Fable 5,但价格仅为后者的一半。文章指出,Opus 5 的核心亮点是“思考档位”机制和主动验证能力,但官方在跑分图表上存在误导性标注,且模型在长程复杂任务和网络安全领域仍落后于 Fable 5 级模型。此外,Anthropic 工程师分享了关于精简系统提示词的新范式,被认为比模型本身更具启示性。适合关注 AI 模型性价比、技术细节与行业动态的读者。原文 ↗

核心观点
  • Opus 5 的核心策略是“半价旗舰”:性能在多项基准测试中逼近甚至超越 Fable 5,但价格仅为后者的一半,性价比突出。
  • 模型能力提升之外,Anthropic 工程师关于“精简系统提示词”的新范式,即从“事无巨细地教模型做事”转向“逐渐将判断权交给模型”,可能是本次发布中最具长远价值的启发。
  1. 01在 CursorBench 3.2 上,开启 max effort 后,Opus 5 与旗舰 Fable 5 的最高分只差 0.5%,成本却只有后者的一半。
  2. 02在 ARC-AGI 3 测试中,Opus 5 面对陌生问题的得分是第二名的三倍。
  3. 03在 OSWorld 2.0 电脑操作测试中,Opus 5 用略高于三分之一的成本,就超过了 Fable 5 的最好成绩。
  4. 04在生命科学评测中,Opus 5 全面超越 Opus 4.8,尤其在有机化学领域提升显著,如从光谱数据推断分子结构高出 10.2 个百分点。
  5. 05Anthropic 工程师 Thariq Shihipar 发现,为 Claude 5 系列编写指令时,可大幅减少系统提示词,Claude Code 的提示词被删除 80% 以上,编程评测成绩未下降。
反方 / 局限
  • 官方在最初发布的 FrontierCode v1.1 对比图中,将 53.4% 加粗标记为最高分,但旁边另一模型成绩为 53.5%,后被网友发现并更正。
  • 沃顿商学院教授 Ethan Mollick 评价,Opus 5 在短任务中可追平甚至超过 Fable 级模型,但面对长时间、高复杂度任务时,最终交付的完整度仍有差距,显得缺乏“雄心”。
  • 在网络安全领域,Opus 5 发现漏洞的能力已逼近 Mythos 5,但编写漏洞利用代码的能力明显落后,高风险的网络攻击请求会被回退到 Opus 4.8 处理。
14 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

延伸追问