6.7
深览指数
科技人人都是产品经理·数字生命卡兹克··AI 生成

Claude Opus 5实测:一半价格的Fable 5替代品?

作者实测了刚发布的Claude Opus 5,认为它在工程任务、Agent任务和真实任务中的完成率已逼近甚至部分超越更贵的Fable 5,但方案设计和规划能力仍不及后者。文章通过具体的代码重构、漏洞排查和UI设计案例,展示了Opus 5在日常工作中的实际价值,并提出了“Fable 5做规划+Opus 5做执行”的混合工作流建议。适合深度使用大模型进行开发、产品设计的从业者阅读。原文 ↗

核心观点
  • Claude Opus 5在工程、Agent和真实任务中的完成率已逼近甚至部分超越Fable 5,但方案设计和规划能力仍不及后者,两者是互补关系而非替代关系。
  1. 01在ARC-AGI-3跑分上,Opus 5达到30.2%,而GPT-5.6 Sol为7.8%,Opus 4.8仅1.5%,Opus 5在抽象推理和陌生任务泛化上优势明显。
  2. 02Opus 5输出价格仅为25美元/百万Token,与Opus 4.8相同,而Fable 5的价格是其两倍。
  3. 03作者用Opus 5审查了GPT-5.6 Sol重构的API代码,发现了两个严重漏洞,包括一个可能被攻击导致账单暴涨的缓存击穿问题。
  4. 04Anthropic为Claude 5系列将Claude Code的System Prompt删减了80%以上,发现编码评测并未出现可测量的下降。
  5. 05作者将工作流调整为:Fable 5负责大体量重构方案规划和底层研究,Opus 5负责常规方案设计、Review和代码执行,GPT-5.6 Sol负责大型代码Review。
反方 / 局限
  • 在写作能力上,Claude Opus 5依然不如Claude Opus 4.6,这是其一个明确短板。
  • 作者指出,模型厂商公布的评测集存在误导性,主要集中在代码、Agent和办公领域,而Fable 5在无工具推理、原生视觉理解、专业医疗表达等极难专业任务上仍有优势。
13 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问