7.0
深览指数
科技Bestblogs·AINLP··AI 生成

DeepSeek-V4.1-Flash 技术报告深度解读:长程 Agent 如何重新分配预算

文章详细拆解了 DeepSeek-V4.1-Flash 技术报告中的三项核心技术优化:CED 架构、CSA2 机制和 FP4 量化。这些设计协同作用,将持久 KV 缓存压缩至原来的八分之一(约 890 字节/token),大幅降低了长上下文任务的推理成本。作者在同类技术解读中做到了定量比资源节省(global KV 占用降至 25%),并指明了优化落地对 Agent 任务效率的直接影响。适合对大模型推理部署和 Agent 落地的 AI 工程师阅读。原文 ↗

核心观点
  • DeepSeek-V4.1-Flash 通过 CED、CSA2、FP4 量化等优化,显著降低了长程 Agent 的 KV 缓存与计算成本,使资源分配从“均匀消耗”变为更灵活的“预算再分配”。
  1. 01CED 架构将主干分为因果编码器和非因果解码器,解码器 global KV 由编码器末层隐藏状态投影产生,省去了逐层计算的开销,prefill 阶段每 token 激活参数从 60B 级别降至 8B。
  2. 02CSA2 通过 Full、Reindex、Reuse 三种模式实现跨层 KV 共享,仅保留每层自有的 query 与注意力计算,避免了多层全独立缓存的重复存储。
  3. 03FP4 量化采用 E2M1 格式在 RoPE 之后对主 KV 进行量化,配合量化感知训练(QAT),在不显著牺牲精度的情况下大幅压缩存储。
  4. 04综合优化后,global KV 占用降至原始 25%,持久缓存总量降至 12.5%(约 890 字节/token),decode 阶段每 token 激活 16B 参数。
  5. 05模型在 DeepSWE v1.1、Terminal-Bench 3.0 和 GPQA Diamond 等长程 Agent 基准测试中取得优异成绩。
反方 / 局限
  • 文章承认 FP4 量化可能带来精度损失,但未给出具体评估,也未讨论低精度下对复杂推理任务的可能影响。
4 分钟 · 2 卡片 · 6 资料
读原文 →

前置背景

技术原理