8.4
深览指数
产品人人都是产品经理·Emily··AI 生成
DeepSeek V4.1 Flash 评测:一个 Flash 档模型,把自家旗舰挤下了线
DeepSeek V4.1 Flash 以 5520 亿参数、仅激活 80 亿的架构,通过非对称 CED 结构将 KV Cache 砍至前代的四分之一,闲时输出每百万 token 仅 4 元,在编码和智能体任务上追平甚至超越旗舰 Claude Opus 5.0,迫使官方将自家旗舰 V4 Pro 的请求路由到它。但最难的推理任务上仍落后 Opus 5.0 近一倍(HLE 36.8 vs 56.3),且切换通知仅一天,引发社区争议。本文以实测数据和成本模型切入,适合正在评估 LLM 选型的开发者与决策者。原文 ↗
核心观点
- ▍V4.1 Flash 的真正价值不是榜单碾压,而是通过结构创新将长上下文和多模态能力变成廉价、可私有化的基础设施,迫使旗舰模型降价让位。
- 01模型采用 CED 非对称结构,前 20 层编码器读入只激活 8B,后 20 层解码器生成激活 16B,精准匹配智能体场景「读多写少」的 token 分布。
- 02KV Cache 压缩至约 890 字节/ token,相比上一代 HBM 需求降到四分之一,SSD 需求降到八分之一,原始 V1 缩小 437 倍,闲时缓存命中价仅 0.02 元/百万 token。
- 03官方基准显示,在 DeepSWE v1.1、Terminal-Bench 2.1、Automation-Bench 等编码与 agent 任务中,V4.1 Flash 全面超越 Claude Opus 5.0、GPT-5.6 Sol 以及 GLM-5.3、Kimi-K3。
- 04峰值输出速度 300-500 tokens/s,并发上限 2500(V4 Pro 的 5 倍),1M 上下文 + 384K 最大输出可处理整仓库审计。
- 05价格极为锋利:闲时未命中输入 1 元、输出 4 元/百万 token,智能指数任务花费 0.27 美元,约为 GLM-5.3/Kimi-K3 的七分之一。
反方 / 局限
- — 最难的前沿推理差距明显:Terminal-Bench 4.0 仅 31.2(Opus 5.0 为 51.8),HLE 36.8 vs Opus 5.0 的 56.3,硬核场景不能当旗舰用。
- — token 消耗偏高:同样智能指数任务花费 0.27 美元,高于上一代 V4 Pro 的 0.22 美元,单价优势被话多抵消。
- — 切换方式争议大:V4 Pro 下线通告仅给 4 天准备期,后改口继续提供服务,一个月内路由口径变动两次,版本锁定系统缺乏确定性。
- — 自托管门槛极高:原生 4-bit 骨干加视觉和推测解码约需 310GB 显存,256GB 机器只能重度量化运行,多数团队只能租用 API。
DeepSeek V4.1 FlashCED 结构KV CacheClaude Opus 5.0Claude CodeArtificial AnalysisHugging FaceHLETerminal-BenchHacker News
22 分钟 · 5 卡片 · 14 资料
读原文 →