科技量子位·思邈··AI 生成
AI SSD:大模型推理的存储范式转移
文章核心观点是,随着大模型进入长上下文与复杂推理阶段,KV Cache、MoE专家权重等推理状态正成为AI基础设施中的一级资源,存储(SSD)开始进入Token生成的实时主链路。文章以月之暗面的Mooncake和NVIDIA的CMX为信号,论证了推理系统正从“堆叠计算”转向“计算、网络、内存与存储协同”。进而分析了英韧、华为、群联、江波龙、寅谱-联芸等厂商的AI SSD路线,指出SSD必须从被动存储设备演变为参与推理数据路径的可调度层级。适合对AI Infra、存储系统、大模型推理有技术背景的读者阅读,用于理解下一代数据中心架构的演进方向。原文 ↗原文 ↗
核心观点
- ▍AI基础设施正从“堆叠计算资源”进入“协同计算、网络、内存与存储数据路径”的新阶段,推理状态(KV Cache、MoE专家)正在成为一级资源,存储开始参与Token生成的实时主链路。
- ▍AI SSD的竞争最终会演变为完整数据路径的竞争,厂商需要建立从NAND介质、FTL、固件到推理框架的完整协作体系,而非仅提升单盘峰值性能。
- 01月之暗面的Mooncake采用以KV Cache为中心的分离式架构,将Prefill与Decode分离,利用集群中未被充分利用的CPU、DRAM、SSD和NIC组成分布式KV Cache池,在真实负载下将有效请求承载能力提升了59%至498%。
- 02NVIDIA的CMX在HBM与共享存储(G4)之间增加了名为“G3.5”的Pod级Flash上下文层,可在单个GPU Pod内提供PB级共享上下文容量,长上下文和智能体负载的持续Token吞吐与功耗效率最高可达传统存储方案的5倍。
- 03群联aiDAPTIV将专用高耐久缓存SSD(最高100 DWPD)与内存管理中间件组合,在VRAM不足时流式搬运模型权重和KV Cache,适用于单机和小型集群。
- 04江波龙路线以SPU(5nm工艺)为硬件执行层,iSA为软件决策层,在SSD主控内部实现存内无损压缩、HLC高级缓存和混合NAND调度,面向AI PC和端侧设备。
- 05寅谱-联芸方案从AI推理芯片和系统协同出发,围绕MoE专家、KV Cache和数值精度进行数据切分、冷热分层和预测式预取,试图将数据组织方式直接匹配模型执行过程。
- 06传统SSD的FTL以页读取、以块擦除,且不了解模型层、KV块和MoE专家的执行次序,导致持续写入KV Cache可能带来写放大和难以预测的尾延迟。
反方 / 局限
- — 文章指出,NVIDIA的CMX数据属于厂商发布口径,实际收益仍会受到模型、缓存命中率、网络和调度策略影响,存在不确定性。
- — 文章暗示,寅谱-联芸路线需要同时处理模型、运行时、操作系统、固件、主控和NAND之间的接口,软硬件协同范围广,研发与验证成本高,存在落地风险。
18 分钟 · 5 卡片 · 13 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问