6.9
深览指数
科技微博·量子位··AI 生成
半价干翻Fable 5?Opus 5实测炸场,网友:差点从椅子上摔下来
Anthropic 发布新一代模型 Opus 5,多项硬核评测追平甚至反超 OpenAI 的 Fable 5,价格仅为后者一半。文章通过大量网友实测案例(如复刻 Rocket League、3D 波音 747 自检模型)和官方基准测试(Frontier-Bench、ARC-AGI-3)展示其编程与物理推理能力。同时,Anthropic 工程师透露,为适配 Opus 5 更强的判断力,Claude Code 的系统提示词被删减超过 80%,验证方式从规则硬编码转向模型自主判断。适合关注 AI 模型能力演进、性价比与工程化落地的读者。原文 ↗
核心观点
- ▍Opus 5 在多项硬核编程和推理测试中追平或反超 Fable 5,但价格仅为后者一半,是当前性价比最高的顶级模型之一。
- ▍Anthropic 为适配 Opus 5 更强的判断力,将 Claude Code 的系统提示词删减超过 80%,验证方式从规则硬编码转向模型自主判断,这标志着模型能力已足够支撑从“脚手架”到“自主决策”的范式转变。
- 01Frontier-Bench v0.1 上,Opus 5 得分 43.3%,超过 Fable 5 的 33.7%,是上一代 Opus 4.8 的 2 倍。
- 02ARC-AGI-3 测试中,Opus 5 得分 30.2%,远超 GPT-5.6 Sol 的 7.8%,比 Opus 4.8 翻了近 20 倍。
- 03网友 Victor M 测试中,Opus 5 用 71 分钟、20 个模块、4000 行代码重建波音 747 模型,并自行提取轮廓测量 14 项指标核对公差;Fable 5 仅用 42 分钟但未做任何自验证。
- 04Opus 5 在 OSWorld 2.0 电脑操作测试中得分 70.6%,高于 Fable 5 的 66.1%,且成本仅为后者的三分之一。
- 05Opus 5 安全护栏触发频率比 Fable 5 降低约 85%,缓解了用户对 Fable 5 过度守口如瓶的抱怨。
反方 / 局限
- — 文章虽强调 Opus 5 性价比,但未深入讨论其长期推理深度、多轮对话一致性以及在极其复杂的长尾任务(如全栈开发)中是否仍能保持优势。
- — 部分网友测试(如复刻 Rocket League)仅用 27% 的 Max 额度,暗示在低预算下表现可能波动,文章未给出不同预算水平下的稳定性数据。
10 分钟 · 3 卡片 · 7 资料
读原文 →