7.2
深览指数
科技虎嗅·数字生命卡兹克©··AI 生成

一夜三连发,Claude Opus5.5、GPT-6 Sol和Luna全部都来了。

Anthropic和OpenAI在同一天发布中端性价比模型Claude Opus 5.5与GPT-6 Sol/Luna,意图将旗舰级能力下放到更低价格区间。作者认为这是两巨头从高端市场向下兼容的「苹果化」打法,模型供应链已成熟到可以全域通吃。Opus 5.5在沟通感和审美上表现突出,但Agent任务成本和复杂长推理仍是短板;GPT-6 Sol识别力大幅降本但细节能力有压缩,Luna则瞄准批量化自动任务。文章适合高频使用模型做Coding或Agent的开发者与技术决策者阅读。原文 ↗

核心观点
  • Anthropic和OpenAI在同一天推中端模型,实质是旗舰级能力(Fable 5.1/Astra)的蒸馏下放,目标是让用户用更少钱买到更多智能,这是典型的「苹果化」供应链成熟后的全域通吃策略。
  1. 01Opus 5.5相比上一代Opus 5工作成本下降40%,输出速度提升30%+。输入价格4美元/百万Token,输出20美元/百万Token。
  2. 02Opus 5.5在Coding任务(如Terminal-Bench 4.0得分66.4%)达到SOTA,但在跨软件自动化(AutomationBench 40.0%)和科研任务(Terminal-Bench-Science 58.7%)上仍弱于GPT-6 Astra(41.4%/64.6%)。
  3. 03GPT-6 Sol和Luna比GPT-5.6的同款模型便宜50%,其中Luna的输入/输出单价已低于DeepSeek,但缓存价格仍高出约3倍。
  4. 04在AutomationBench基准上,GPT-6 Sol xhigh得分33.2%,单任务成本0.27美元;GPT-6 Astra low得分30.3%但成本为Sol的3.9倍;Fable 5.1加Opus 5 fallback得分31.4%但成本至少是Sol的8.9倍。
  5. 05作者实测发现GPT-6 Sol在审美和细节(如操控Blender建模)上有明显降级,但事实错误率已优化到接近GPT-6 Astra级别。
  6. 06Opus 5.5的每任务输出Token数「直接爆炸」,用超长推理换智力,一旦陷入困境就会持续烧钱。作者引用Anthropic提示:结果重要时务必用最高级模型。
反方 / 局限
  • Opus 5.5虽强,但其超长Token消耗在高难任务中反而比旗舰模型更烧钱,这是一个「陷阱」。单看评测集无法评估模型真实质量,尤其是规划和架构设计这类依赖大参数和世界知识的能力。
  • GPT-6 Sol和Luna目前未在Chat上提供(聊天模式仍用GPT-5.6 Sol),作者认为这令人不解——既然成本已降,为什么不在用户量最大的聊天场景切换。
  • 作者承认Claude Opus 5.5在通信和创新上仍比GPT-6 Astra差「一小截」,且Anthropic风险极高(作者号常被封)。国产模型在规划/方案(Kimi K3、Qwen 3.8 Max)与执行(GLM-5.3、DeepSeek V4.1 Flash)上可替代,但整体梯队不如两巨头。
19 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问