7.3
深览指数
商业虎嗅·光锥智能··AI 生成

三个月价格腰斩,大模型的“聪明”正在贬值?

文章以 LLM Token 支出指数三个月内腰斩(5 月超 2 美元/百万 Token,8 月跌破 1 美元)为核心现象,分析了背后的双重驱动:需求端企业用户不堪 API 成本重负(如 Uber 预算告罄),供给端厂商通过发布 Flash 性价比模型、优化缓存成本与输出 Token 量等方式主动降价。作者认为,模型能力“通胀”与价格“通缩”并存,杰文斯效应短期内因应用场景爆发滞后于价格崩塌而部分失效,但智能泛化(如 GPT-6 Astra 的具身能力)可能孕育下一轮用量红利。适合关注 AI 产业商业逻辑与定价权的从业者。原文 ↗

核心观点
  • 大模型 Token 支出价格遭遇腰斩是智能通胀与价格通缩并存的体现,性价比正取代绝对智能成为行业新的角力点。
  1. 018 月 LLM Token 支出指数单月暴跌 29%,至 0.97 美元/百万 Token,从 5 月的 2 美元以上腰斩。
  2. 02Uber 在 2024 年 4 月就已用完全年 AI 预算,每名工程师月均 API 调用成本高达 500-2000 美元,且 AI 支出与业务价值增长难以挂钩。
  3. 03OpenAI 一个月内两次降价,先对 GPT-5.6 Luna 永久降价 80%,后对旗舰模型 GPT-5.6 Sol 的输入/输出降价 20% 和 33%。
  4. 04Qwen3.8-Flash 的训练开销仅为旗舰 Qwen3.7-Plus 的 1/9。
  5. 05Claude Fable 5.1 将缓存命中读取费用从 1 美元降至 0.25 美元/百万 Token(-75%),以补贴 Agent 场景。
  6. 06DeepSeek 通过架构、注意力和缓存精度优化,大幅压缩 KV 缓存空间从源头降成本。
  7. 07GPT-6 Astra 使用了 10 万张 GPU 集群,硬件采购成本约 30 亿美元。
  8. 088 月 OpenRouter 路由 Token 量环比增长约 47%,但美元支出微增 7%;Token 使用量前十的模型中低价 Flash 模型占据半数以上。
反方 / 局限
  • 作者指出杰文斯效应短期失灵,因为新应用场景的爆发(如 Agent、企业工作流)跟不上价格崩塌的速度。
  • GPT-6 Astra 展现出通用模型向具身智能延伸的能力,但任务执行流畅性依然初级。
  • OpenAI 通过优化输出 Token 压缩单次任务的 Token 消耗量,但用户反映 GPT-6 Astra 的额度消耗反而更快,暗示优化速度可能跟不上模型能力膨胀带来的消耗增长。
15 分钟 · 5 卡片 · 10 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问