8.3
深览指数
科技腾讯新闻·机器之心··AI 生成
DeepSeek V4.1 Flash用了哪些黑科技?竟让Flash(差点)逼退Pro
DeepSeek V4.1 Flash 以 552B 参数、激活仅 16B 的性能,在多项评测中超越 1.6T 参数的 V4 Pro,关键在于围绕 KV 缓存压缩的架构创新。本文基于官方技术报告,拆解了 CED(因果编码器-解码器)将 prefill 计算减半、CSA2 在条目/序列/层三个维度同时压缩存储、FP4 量化以及基于 Bounded Replay 的部署优化。此外,文章介绍了首次进入正式版的 Engram 记忆模块、Single-Pass mHC 训练稳定性优化和可调节的 reasoning effort 机制。适合对 LLM 架构前沿有技术背景的读者,或关心大模型推理效率的工程师。原文 ↗
核心观点
- ▍DeepSeek V4.1 Flash 的核心设计目标单一且明确:极致压缩 KV 缓存。模型在架构 (CED/CSA2)、精度 (FP4) 和部署 (Bounded Replay) 三个层次同时发力,将全局 KV 缓存压至 V4 Flash 的 1/4,从而以远小于 Pro 的参数量实现同等或更强的性能。
- ▍V4.1 Flash 552B参数之所以能‘击败’1.6T的V4 Pro,比较的核心不是单次推理的FLOPs,而是在同一次agent调用中,模型占用的显存、从SSD搬运的数据量和需要重算的prefill次数。
- 01V4.1 Flash 采用 CED(Causal Encoder-Decoder)架构,将40层切分为20层编码器+20层解码器。解码器各层的KV条目由编码器最后一层的隐藏状态通过独立投影矩阵生成,prefill阶段仅需计算前20层,复杂度从O(NL)降至约O(NL/2)。
- 02CSA2(Compressed Sparse Attention 2)在条目大小、序列维度和层维度三个压缩维度上同时优化,为每个CSA2层静态分配Full/Reindex/Reuse三种模式之一,以最大化跨层KV缓存共享。
- 03V4.1 Flash 将Main KV缓存精度从FP8进一步压至FP4(E2M1格式,每16通道配一个E4M3缩放因子),这是在V4对索引器部分做FP4量化基础上的推进。
- 04部署层面,模型将SWA KV完全移出持久化缓存,放入由10%主机DRAM组成的分布式内存池(TTL数分钟),通过 Bounded Replay(仅回放最近的n_win=128个token)应对偶尔的缓存未命中。这使得持久化KV缓存降至V4 Flash的约1/8。
- 05Engram 条件记忆模块首次进入正式版模型:196B参数,平均分配于第1层和第14层,使用{2,3,4}阶N-gram、8个哈希头,通过确定性寻址从主机内存RDMA预取,实现静态知识的O(1)检索。
- 06投机解码模块 DSpark 由3个Transformer block组成,在预训练后单独训练;后训练阶段回调梯度不返回,持续对齐策略的同时加速线上服务和RL的rollout生成。
- 07模型支持可调节的reasoning effort(1-100标量),effort上限对应2.5倍输出token;从60到80档已能用不到一半的token预算接近满档准确率,报告建议将max档留给最难任务。
- 08优化器创新:Q/K权重使用按头切分的head-wise Muon;Engram嵌入表、token嵌入和预测头使用动量更新+Sinkhorn平衡替代Adam,节省一个动量缓冲的显存。
反方 / 局限
- — CED架构中,滑动窗口注意力(SWA)仍需要逐层计算,在多轮短提示场景下,Bounded Replay的近似处理可能带来精度损失,作者将其描述为‘接受近似’换来的收益。
- — Artificial Analysis测试显示V4.1 Flash是‘冗长度最高的模型之一’(max effort档)。后训练部分也承认effort从80走到100时,agent轨迹增长1.6-1.8倍,仅带来边际提升,说明高推理开销在某些场景下是不经济的。
- — 后训练章节坦率表示‘没有引入新的后训练算法’,所有改动均在数据管线上。这表明模型在当前阶段的软上限不在算法,而在于更成熟的数据工程。
DeepSeekDeepSeek V4.1 FlashKV缓存CED架构CSA2Bounded ReplayEngramFP4量化Sebastian RaschkaArtificial AnalysisSingle-Pass mHCDSparkReasoning Effort
18 分钟 · 4 卡片 · 10 资料
读原文 →