8.0
深览指数
科技量子位··AI 生成

字节找到了DeepSeek时强时弱的原因

字节Seed团队发现,DeepSeek-V4系列模型在长上下文任务中的表现存在周期性波动,周期恰好对应其KV Cache压缩步长。通过代码补全和大海捞针测试揭示,模型对不同“相位”的信息检索能力差异可达40个百分点,并将该问题归因于分块KV Cache压缩机制本身。这项发现挑战了当前长上下文优化的主流做法,并提出评估此类模型时应纳入相位敏感性指标。适合关注大模型效率优化、长上下文推理可靠性的研究者与工程师阅读。原文 ↗

核心观点
  • ▍DeepSeek-V4系列模型在长上下文任务中的神鬼二象性,根源在于其采用的分块KV Cache压缩技术,该技术会引入系统性的、与信息输入位置(相位)相关的检索能力周期性波动。
  1. 01在代码补全测试中,只在代码前增减无关的等号字符,DeepSeek-V4模型的答案就在正确(8)和错误(32)之间以4个Token为周期交替变化。
  2. 02在128K Token的大海捞针任务中,仅调整目标信息在上下文中的相位,DeepSeek-V4-Flash-Base的最大检索准确率差距达40.2个百分点,后训练模型差距缩小至14.8-19.1个百分点。
  3. 03DeepSeek-V4.1将压缩步长从4变为2后,其性能波动的周期也随之变为2个Token,进一步确认了波动与压缩步长的直接关联。
  4. 04Seed团队以Qwen3-0.6B为基础自训练模型的实验证实,所有采用分块KV Cache压缩的模型都出现了与压缩步长对应的周期性波动,而全注意力基线模型则没有。
  5. 05实验发现不同注意力头对不同相位的信息处理能力存在偏好,即“相位专门化”,这可能是模型在学习压缩时自然形成的结果。
反方 / 局限
  • — 论文指出,后训练(如RLHF、SFT)和架构迭代(如DeepSeek-V4.1)可以显著缩小相位带来的性能差距,说明该问题并非不可解决,可能随着模型迭代而缓解。
  • — Seed团队提出的问题虽然在长上下文基准测试中明显,但传统评测往往通过平均分掩盖了这种周期性差异,可能导致业界对此问题的低估。
10 分钟 · 4 卡片 · 8 资料
读原文 →

技术原理

平行视角

未来推演

延伸追问