7.0
深览指数
科技虎嗅·AppSo··AI 生成

Claude Opus5发布,半价追平Fable5

Anthropic 发布新模型 Claude Opus 5,主打高性价比:在多项基准测试中性能逼近旗舰模型 Fable 5,但价格仅为后者的一半,通过支持调节思考档位(effort)实现了成本与性能的灵活取舍。文章还介绍了 Opus 5 在编程、科研等领域的突出表现,以及安全策略与模型回退机制。最后,文章分享了 Anthropic 工程师关于给模型写指令的新发现——减少明确规则、让模型自主判断,反而效果更好,这一洞见对 AI 应用开发者具有实操价值。原文 ↗

核心观点
  • Anthropic 发布的新模型 Claude Opus 5 核心卖点是高性价比:在多项基准测试中性能接近旗舰模型 Fable 5,但价格仅为后者的一半。
  1. 01Anthropic 引入了可调节的思考档位(effort),用户可在推理能力、速度、成本和 token 消耗之间自行权衡。
  2. 02在 CursorBench 3.2 测试中,开启 max effort 后,Opus 5 与 Fable 5 的最高分只差 0.5%,成本却只有后者的一半。
  3. 03在 ARC-AGI 3 测试中,Opus 5 面对陌生新任务的得分达到第二名模型的三倍。
  4. 04Opus 5 在生命科学多项评测中全面超越前代 Opus 4.8,尤其在有机化学领域提升显著,如根据光谱数据推断分子结构准确率高出 10.2 个百分点。
  5. 05Opus 5 具备主动验证结果的能力,例如在无视觉工具下自行编写算法完成 3D 重建,或为修复开源 bug 找到社区补丁遗漏的边界问题。
  6. 06Anthropic 称 Opus 5 是其行为最符合预期的模型,对行为准则的遵循程度更高,更难被诱导执行危险操作。
反方 / 局限
  • 沃顿商学院教授 Ethan Mollick 评价,Opus 5 在短任务中可追平甚至超过 Fable,但在长时间、复杂任务中欠缺“雄心”,交付完整度仍有差距,且继承了 Fable 对高密度表达的偏好,带有“Fable 味”。
  • 在网络安全领域,Opus 5 发现漏洞的能力已逼近更强的 Mythos 5,但将其转化为真实攻击工具的能力仍有明显差距。一旦触发高风险安全限制,系统会将任务回退到 Opus 4.8 处理。
  • Anthropic 在发布初期提供的对比图中,FrontierCode v1.1 一项将 Opus 5 的 53.4% 加粗标记为最高分,但另一模型实际分数为 53.5%,被发现后官方已更换图片。
17 分钟 · 3 卡片 · 7 资料
读原文 →

前置背景

平行视角

延伸追问