7.0
深览指数
科技Bestblogs·AINLP··AI 生成
DeepSeek-V4.1-Flash 技术报告深度解读:长程 Agent 如何重新分配预算
文章详细拆解了 DeepSeek-V4.1-Flash 技术报告中的三项核心技术优化:CED 架构、CSA2 机制和 FP4 量化。这些设计协同作用,将持久 KV 缓存压缩至原来的八分之一(约 890 字节/token),大幅降低了长上下文任务的推理成本。作者在同类技术解读中做到了定量比资源节省(global KV 占用降至 25%),并指明了优化落地对 Agent 任务效率的直接影响。适合对大模型推理部署和 Agent 落地的 AI 工程师阅读。原文 ↗
核心观点
- ▍DeepSeek-V4.1-Flash 通过 CED、CSA2、FP4 量化等优化,显著降低了长程 Agent 的 KV 缓存与计算成本,使资源分配从“均匀消耗”变为更灵活的“预算再分配”。
- 01CED 架构将主干分为因果编码器和非因果解码器,解码器 global KV 由编码器末层隐藏状态投影产生,省去了逐层计算的开销,prefill 阶段每 token 激活参数从 60B 级别降至 8B。
- 02CSA2 通过 Full、Reindex、Reuse 三种模式实现跨层 KV 共享,仅保留每层自有的 query 与注意力计算,避免了多层全独立缓存的重复存储。
- 03FP4 量化采用 E2M1 格式在 RoPE 之后对主 KV 进行量化,配合量化感知训练(QAT),在不显著牺牲精度的情况下大幅压缩存储。
- 04综合优化后,global KV 占用降至原始 25%,持久缓存总量降至 12.5%(约 890 字节/token),decode 阶段每 token 激活 16B 参数。
- 05模型在 DeepSWE v1.1、Terminal-Bench 3.0 和 GPQA Diamond 等长程 Agent 基准测试中取得优异成绩。
反方 / 局限
- — 文章承认 FP4 量化可能带来精度损失,但未给出具体评估,也未讨论低精度下对复杂推理任务的可能影响。
DeepSeek-V4.1-FlashCED (Causal Encoder-Decoder)CSA2 (Compressed Sparse Attention 2)FP4 量化KV 缓存Engram 记忆模块DSpark 草稿机制DeepSWE v1.1Terminal-Bench 3.0GPQA Diamond
4 分钟 · 2 卡片 · 6 资料
读原文 →