8.1
深览指数
科技腾讯新闻·爱范儿··AI 生成

DeepSeek给大模型划出的“斩杀线”,斩的到底是什么

本文以DeepSeek V4 Flash在OpenCode单日消耗8万亿Token这一惊人数据为引,指出Agent时代模型价值衡量标准已从“单次回答多聪明”变为“完成长任务花多少钱、多久、失败几次”。作者的核心判断是:DeepSeek通过极致的架构创新(MoE、CSA/HCA注意力)将推理成本压至近两个数量级低于对手,定义了一条“斩杀线”——它不需要成为最强,只要在大多数任务上“够用”,就能利用价差将更贵的模型挤出默认调用位。文章深入分析了V4 Flash的架构和后训练如何提升Agent能力,并指出这一趋势正在改变整个行业的竞争逻辑:未来模型厂商出售的不再是“每一个Token的智能”,而是“每一美元能完成多少工作”。适合关注AI产业格局、模型成本与商业化、Agent技术趋势的读者阅读。原文 ↗

核心观点
  • DeepSeek V4 Flash定义了一条“斩杀线”:它不需要成为最强模型,只要达到“大多数时候可以做完”,就能利用近两个数量级的价格差,把更贵的模型挤出默认调用位。
  • Agent时代,模型的价值衡量标准已从“单次回答有多聪明”转变为“完成一项长任务要花多少钱、多久、失败几次”。
  1. 01DeepSeek V4 Flash在OpenCode一个入口里单日消耗8万亿Token,超过了接入400多款模型的OpenRouter全平台日均6.6万亿Token的规模。
  2. 02DeepSeek V4 Flash百万输出Token价格为2元人民币,而Anthropic Claude Opus 4.8标准价格为25美元(约170元),价差约85倍。
  3. 03在Artificial Analysis的Intelligence Index评测中,V4 Flash Max得50分,调用费约72美元;Claude Opus 4.8 Max得56分,调用费约3752美元,多拿6分但调用费高出约52倍。
  4. 04V4 Flash总参数量2840亿,但每个Token只激活约130亿参数,这是其低价的核心技术原因。
  5. 05V4系列通过修改Transformer的注意力层(CSA/HCA机制)和MoE前馈层大幅降低推理成本,估算在一百万Token上下文下单Token推理计算量约为V3.2的10%。
  6. 06V4 Flash正式版没有改变架构和规模,只通过后训练(SFT、GRPO、On-Policy Distillation)重点提升编码和Agent能力,在Terminal Bench 2.1上获得82.7分。
  7. 07社区项目DwarfStar通过低比特量化,可以将V4 Flash的q2版本放入96GB或128GB统一内存设备中运行,降低了本地部署门槛。
反方 / 局限
  • 作者承认,V4 Flash当然还不能证明自己全面超过Opus,但只要两者已经被放进同一轮候选名单,85倍的价差就足以改变默认选择。
  • 作者暗示,极低比特量化(q2版本)可能损伤代码、长上下文和工具调用能力,社区运行时本身也仍处于早期阶段,本地部署无法复现官方API的Agent成绩。
14 分钟 · 3 卡片 · 9 资料
读原文 →

前置背景

未来推演

延伸追问