7.1
深览指数
科技腾讯新闻·智猩猩··AI 生成

DeepSeek V4.1 Flash技术报告公开!KV Cache压到极限,HBM需求降至1/4

DeepSeek 发布 V4.1 Flash 技术报告,核心思路是通过 CED、CSA2 等架构创新,将 KV Cache 压缩到约每 Token 890 字节(仅为 V4 Flash 的 1/4),从而大幅降低 HBM 需求和部署成本。该模型为 552B 参数的 MoE,但 Prefill 阶段仅激活 8B 参数,在智能体相关任务上追平或接近前沿水平。报告诚实标注了长上下文和部分复杂推理上的短板,并明确指出所有创新围绕“降本”这一单一目标展开,是一份技术导向明确、干货密集的工程报告。适合 AI 研究员、算法工程师及关注大模型部署成本的从业者阅读。原文 ↗

核心观点
  • DeepSeek V4.1 Flash 的核心工程目标是极限压缩 KV Cache,以降低长序列推理场景下的 HBM 占用量与部署成本,而非单纯追求参数量或基座能力提升。
  1. 01V4.1 Flash 的全局 KV Cache 常驻 HBM 时,每 Token 仅需约 890 字节,相比 V4 Flash 降至约 1/4;持久化 KV Cache 常驻 SSD 时,降至 V4 Flash 的约 1/8。
  2. 02核心架构设计 CED (Causal Encoder-Decoder) 让 552B 总参数的模型在 Prefill 阶段仅激活 8B 参数,约将 Prefill 计算量减半。
  3. 03与之配合的 CSA2 在层间共享全局 KV 并复用稀疏选择结果,以及 FP4 KV Cache 和 SWA Bounded Replay 等工程优化,共同支撑了极致的压缩效果。
  4. 04预训练语料达 45T Token,稀疏注意力从零开始直接在 64K 序列长度上训练,无 Dense Attention 热身阶段。
  5. 05后训练未引入算法创新,所有优化集中在数据合成、环境构建和 RL 轮次的规模化扩展上,支撑平台为 DSec 沙箱,训练时达到数百万并发沙箱实例。
  6. 06后训练评测显示,在 Terminal-Bench 2.1 等智能体任务上达到 90.6 分,追平前沿;但在 HLE 等复杂推理基准上与 Opus-5 仍有明显差距。
反方 / 局限
  • 报告主动标注,CSA2 的选择误差和 SWA Bounded Replay 的近似状态重建,在未经测试的边界情形下可能造成能力退化。
  • 模型虽能完成超 95% 真实世界任务,但在 Terminal-Bench 4.0 这类“科学导向”的智能体任务上仍有不足,长上下文和部分复杂推理仍是短板。
  • 作者暗示,V4.1 Flash 更像是面向 Agent 场景的系统级试验,真正的技术上限可能要在后续的 V4.1 Pro 或下一代模型中才能体现。
9 分钟 · 4 卡片 · 8 资料
读原文 →

前置背景

技术原理

平行视角

延伸追问