商业虎嗅·光锥智能··AI 生成
三个月价格腰斩,大模型的“聪明”正在贬值?
文章以 LLM Token 支出指数三个月内腰斩(5 月超 2 美元/百万 Token,8 月跌破 1 美元)为核心现象,分析了背后的双重驱动:需求端企业用户不堪 API 成本重负(如 Uber 预算告罄),供给端厂商通过发布 Flash 性价比模型、优化缓存成本与输出 Token 量等方式主动降价。作者认为,模型能力“通胀”与价格“通缩”并存,杰文斯效应短期内因应用场景爆发滞后于价格崩塌而部分失效,但智能泛化(如 GPT-6 Astra 的具身能力)可能孕育下一轮用量红利。适合关注 AI 产业商业逻辑与定价权的从业者。原文 ↗原文 ↗
核心观点
- ▍大模型 Token 支出价格遭遇腰斩是智能通胀与价格通缩并存的体现,性价比正取代绝对智能成为行业新的角力点。
- 018 月 LLM Token 支出指数单月暴跌 29%,至 0.97 美元/百万 Token,从 5 月的 2 美元以上腰斩。
- 02Uber 在 2024 年 4 月就已用完全年 AI 预算,每名工程师月均 API 调用成本高达 500-2000 美元,且 AI 支出与业务价值增长难以挂钩。
- 03OpenAI 一个月内两次降价,先对 GPT-5.6 Luna 永久降价 80%,后对旗舰模型 GPT-5.6 Sol 的输入/输出降价 20% 和 33%。
- 04Qwen3.8-Flash 的训练开销仅为旗舰 Qwen3.7-Plus 的 1/9。
- 05Claude Fable 5.1 将缓存命中读取费用从 1 美元降至 0.25 美元/百万 Token(-75%),以补贴 Agent 场景。
- 06DeepSeek 通过架构、注意力和缓存精度优化,大幅压缩 KV 缓存空间从源头降成本。
- 07GPT-6 Astra 使用了 10 万张 GPU 集群,硬件采购成本约 30 亿美元。
- 088 月 OpenRouter 路由 Token 量环比增长约 47%,但美元支出微增 7%;Token 使用量前十的模型中低价 Flash 模型占据半数以上。
反方 / 局限
- — 作者指出杰文斯效应短期失灵,因为新应用场景的爆发(如 Agent、企业工作流)跟不上价格崩塌的速度。
- — GPT-6 Astra 展现出通用模型向具身智能延伸的能力,但任务执行流畅性依然初级。
- — OpenAI 通过优化输出 Token 压缩单次任务的 Token 消耗量,但用户反映 GPT-6 Astra 的额度消耗反而更快,暗示优化速度可能跟不上模型能力膨胀带来的消耗增长。
15 分钟 · 5 卡片 · 10 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问