4.9
深览指数
产品智东西·云鹏
专注消费电子、移动通信。··AI 生成
Claude Opus 5来了,Fable 5性能、一半价格
Anthropic发布新一代旗舰大模型Claude Opus 5,性能接近此前发布的Fable 5,但价格仅为后者一半。文章引用多项基准测试数据(Frontier-Bench、CursorBench 3.2、ARC-AGI 3等),展示其在编程、复杂推理、科学研究及视觉输出上的提升,尤其强调自我校验与迭代能力的增强。同时,文章指出在网络安全漏洞利用任务上Opus 5仍大幅落后于Mythos 5,且Anthropic在安全对齐方面做了重点限制。适合关注大模型产品迭代、性价比与安全策略的从业者阅读。原文 ↗
核心观点
- ▍Claude Opus 5的性能接近Fable 5,但价格仅为后者一半,主打高性价比,专为日常高频使用设计。
- 01在CursorBench 3.2最高努力模式下,Opus 5性能距离Fable 5峰值得分仅差0.5%,但单任务成本仅为后者一半。
- 02在ARC-AGI 3测试中(解决全新未知问题),Opus 5得分是第二名模型的3倍。
- 03在Zapier AutomationBench中,相同单任务成本下,Opus 5通过率约为第二名模型的1.5倍。
- 04在OSWorld 2.0测试中,Opus 5仅需略高于三分之一的成本即可超过Fable 5的最佳成绩。
- 05在生命科学评估中,有机化学任务得分比Opus 4.8高出10.2个百分点,蛋白质相关任务提升7.7个百分点。
- 06Opus 5定价为输入每百万Token 5美元/输出每百万Token 25美元,与Opus 4.8持平。
- 07Lovable联合创始人Fabian Hedin认为Claude Opus 5是Opus家族自4.5以来最大的一次飞跃。
反方 / 局限
- — 在网络安全漏洞利用任务上,Opus 5仍大幅落后于Mythos 5,且Anthropic特意避免在该任务上训练模型。
- — 有网友反馈Opus 5的写作风格与4.8很像,与Fable 5不同,有观点认为应称为Fable 5.1而非Opus 5。
AnthropicClaude Opus 5Claude Fable 5Mythos 5Frontier-BenchCursorBench 3.2ARC-AGI 3Zapier AutomationBenchOSWorld 2.0LovableCognitionJetBrains
13 分钟 · 3 卡片 · 9 资料
读原文 →