7.8
深览指数
商业腾讯新闻·字母AI··AI 生成
GPT-6 Sol和Luna上线,打折比梁文锋还狠
OpenAI 在 Anthropic 发布 Opus 5.5 后 90 分钟内,迅速推出 GPT-6 Sol 和 Luna,价格分别为 Opus 5.5 的一半和 1%,竞争焦点从单纯拼能力转向拼性价比。文章对比了多个内测基准(AutomationBench、DeepSWE、OSWorld 2.0)与 Artificial Analysis 综合指数,指出 Sol/Luna 智力水平相较上一代原地踏步,但成本大幅下降,同时点出 MiMo-V2.6 以更低价格实现相近分数。最后提出模型市场正分裂为“冲性能上限”和“压成本下限”两种赢法,中间地带的模型将加速被淘汰。适合关注 AI 产业竞争格局、定价策略与技术商业化的读者。原文 ↗
核心观点
- ▍模型市场正分裂为两种赢法:要么继续冲能力天花板(如 Opus 5.5),要么在相近能力下把价格压到极低(如 Sol/Luna/MiMo),中间地带将加速被淘汰。
- ▍用户选择过多,价格够低时,模型不再需要证明自己比对手更聪明,只要够用就行。
- 01GPT-6 Sol 每百万 Token 输入 2 美元、输出 10 美元,正好是 Opus 5.5 的一半、Astra 的五分之一;Luna 更只有 0.1 美元输入、0.5 美元输出,约为 Astra 的 1%。
- 02在 AutomationBench 中,Sol xhigh 单任务成本 0.27 美元,得分 33.2%;Opus 5.5 max 成本 1.28 美元,得分 40.0%。Sol 以不到 Opus 5.5 四分之一的价格挤入同一前沿 Agent 榜单。
- 03在 DeepSWE v1.1 中,Sol max 得分 68.8%,距离 Fable 5 最高 69.9% 仅差 1.1 个百分点,但 Open AI 估算单任务成本低约 80%;Luna max 得分 66.6%,成本分别比 Opus 5 和 Fable 5 的 medium 档低 93% 和 96%。
- 04Artificial Analysis 最新 Intelligence Index 显示,Sol max 得分 48,上一代 5.6 Sol 为 47;Luna max 得分 37,上一代 5.6 Luna 还高 1 分。综合能力基本原地踏步,但成本显著下降:Sol max 单任务均成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元。
- 05小米 MiMo-V2.6-Pro 在同一指数得 46 分(Sol max 48 分),平均单任务成本仅 0.13 美元,而 Sol 为 1.06 美元,API 价格也远低于 OpenAI。DeepSeek V4.1 Flash 得 39 分(Luna 37 分),但单任务成本 0.27 美元,是 Luna 的近 4 倍。
- 06Sol 和 Luna 事实错误相比上一代减少约一半,已接近 Astra;上下文最高 105 万 Token、输出 128K Token,支持所有工具(网页搜索、代码解释器、Computer Use 等),推理档位多一个 none 选项。
- 07Grok 4.7 xhigh 得 46 分,与 MiMo-V2.6-Pro 同分,但单任务成本 3.74 美元,是 MiMo 的 28.8 倍。
- 08同一晚 OpenAI 和 Anthropic 都调整了模型回复风格:减少行话、奇怪措辞、低价值细节,给模型“去 AI 味”。
反方 / 局限
- — 文章承认,Computer Use 测试 OSWorld 2.0 上 Sol 的 60.5%(OpenAI 自测)与 Opus 5.5 的 81.8%(Anthropic 自测)是不同评测设置,不能直接比较,需要等待第三方横测。
- — 文章暗示,Sol 和 Luna 的“便宜”有长上下文价格翻倍限制(单次请求超过 27.2 万 Token 后价格翻倍),且 105 万上下文与 0.1 美元不能直接相乘。
- — 文章末尾提及“做应用”的终局可能:Meta 的 Muse 上线后股价大涨,暗示当模型卷不动时,产品生态和用户规模或许才是真正的护城河。
GPT-6 SolGPT-6 LunaOpus 5.5MiMo-V2.6-ProGrok 4.7DeepSeek V4.1 FlashAutomationBenchDeepSWE v1.1OSWorld 2.0Artificial AnalysisIntelligence IndexOpenAIAnthropic小米MetaMuse
14 分钟 · 3 卡片 · 8 资料
读原文 →