7.9
深览指数
科技微博·量子位··AI 生成

把记忆交给CPU,大模型会变快

文章指出,大模型推理中长上下文与高并发场景下的性能瓶颈,核心不在GPU算力,而在于KV Cache的管理。作者提出,KV Cache是Transformer模型推理时产生的中间状态缓存,其大小随上下文和请求量急剧膨胀,远超GPU显存容量。破局之道是让CPU接管记忆管理:利用CPU侧大容量内存和存储进行分层卸载,并引入硬件压缩(如英特尔QAT)来降低缓存体积与搬运开销。文章以英特尔KV Shrink等技术方案为例,展示了TTFT最高约5倍加速的测试结果,为数据中心运营方提供了一条“以存代算”的优化路径。原文 ↗

核心观点
  • 大模型推理性能瓶颈的根因是KV Cache过大,而非GPU算力不足,解决之道在于利用CPU进行分层缓存管理和硬件加速压缩。
  1. 01Qwen3-8B模型在BF16精度下,每Token的KV数据约为147KB;若缓存100万Token,单请求KV数据即达约147GB。
  2. 02假设300万日活用户,每人每天10个1M请求,日累计KV数据规模达约4410PB。
  3. 03英特尔提出的KV Shrink方案,通过重排KV Cache存储格式,使压缩算法的空间节省从10%以上提升到20%-30%(无损压缩)。
  4. 04在双路至强6554S+两张L20 GPU+Qwen3-32B模型、80%缓存命中率下,KV Shrink相较原生vLLM基线,TTFT最高获得约5倍加速。
  5. 05相比仅依赖CPU Core的软件压缩,英特尔QAT硬件压缩方案整体性能约为前者的两倍,且额外TTFT开销低于10%。
  6. 06在面向Coding Agent的测试中(双路至强+八张H800+Qwen3-32B),KV Shrink相较LMCache方案,单路负载平均TTFT从129.81毫秒降至114.13毫秒。
反方 / 局限
  • 作者明确提及,压缩和解压本身会带来额外开销,若通用CPU核心处理,可能挤占其他资源并成为瓶颈,需要专用硬件(如QAT)来解决。
  • 文中测试结果(如TTFT加速5倍)依赖于特定硬件配置、模型和缓存命中率(80%),运营方实际部署效果需根据自身负载重测,不能直接套用。
12 分钟 · 4 卡片 · 7 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问