科技腾讯新闻·AI寒武纪··AI 生成
来自Claude Opus 5的震撼:多项跑分锤爆Fable 5,价格却腰斩
文章介绍了Anthropic新发布的Claude Opus 5模型,声称其多项跑分超越高端型号Fable 5,但价格仅为后者一半。核心亮点包括Opus 5在软件工程、知识工作、生命科学等领域的显著性能提升,以及其极强的自我验证和迭代能力。文章还提供了针对Opus 5的提示词编写指南,强调其自动纠错特性,并建议开发者避免冗余指令。适合AI开发者、技术决策者了解模型选型与成本优化。原文 ↗原文 ↗
核心观点
- ▍Claude Opus 5在多项基准测试中跑分超越高端型号Fable 5,但价格仅为后者一半,是性价比极高的日常编程及高频使用模型。
- 01在CursorBench 3.2测试中,Opus 5的得分与Fable 5峰值仅差0.5%,但单任务成本只有一半。
- 02在ARC-AGI 3评估中,Opus 5的得分是第二名模型的三倍。
- 03在OSWorld 2.0电脑操作基准测试中,Opus 5仅用三分之一成本就打破了Fable 5的最佳成绩。
- 04在生命科学评估中,Opus 5在推断分子结构等有机化学任务上得分提高10.2个百分点,在预测蛋白质序列变异影响方面得分提高7.7个百分点。
- 05在早期测试中,研究人员故意遮挡机器零件图纸,Opus 5自行编写计算机视觉管道从原始像素中提取几何图形,完美重建3D模型。
- 06一家交易公司工程师让Opus 5为新交易所构建市场数据流,由于缺乏实时数据验证,Opus 5自行搭建测试工具检查代码解析。
- 07Opus 5定价与Opus 4.8一致,输入每百万Token 5美元,输出每百万Token 25美元。
反方 / 局限
- — Opus 5仅在网络安全任务上落后于Mythos 5,暗示其在特定安全领域可能不如竞品。
- — Opus 5默认话痨属性明显,且过度倾向于召唤子智能体,在小任务上可能导致成本翻倍,需要开发者通过提示词严格限制。
概念锚点
前置背景
平行视角
未来推演
延伸追问