7.7
深览指数
产品微博·量子位··AI 生成
“接力跑”盘活算力,PD分离终于破局:延迟砍半、成本直降近40%
无问芯穹在WAIC 2026上公布了跨集群异构推理架构PDD,通过将传统PD分离解构为P-RLD-MD三级架构,解决了广域以太网传输KV Cache的延迟瓶颈。实测数据显示,该架构在首Token延迟降低51.5%的同时,单Token成本降低37.5%,有效盘活了分散的存量算力。文章详述了从硬件性能偏科、DRC缓存技术到非均匀延迟分布等底层洞察,以及三层接力设计的具体实现,适合关注大模型推理优化、分布式系统与算力调度的技术从业者。原文 ↗
核心观点
- ▍PDD(Prefill-RelayDecode-MainDecode)三级架构通过在本机房的RLD实例上抢先解码,有效掩盖了跨集群以太网传输KV Cache的长尾延迟,实现首Token延迟降低51.5%,单Token成本降低37.5%。
- ▍极简局部异构+灵活远端分离的部署范式,能够以低成本广域以太网串联各地已建成的同构集群,盘活存量算力,是下一代MaaS基础设施的核心设计理念。
- 01微基准测试发现,真实业务中约70%-80%的请求KV Cache命中率在95%以上,只有极少数低命中率请求产生长尾延迟,这为针对性优化提供了前提。
- 02在90%的平均命中率下,DRC(前缀缓存RadixCache)技术理论上能将跨集群KV Cache的带宽需求降低10倍。
- 03真实业务600万条请求分析显示,输出Token少于100个的请求约占30%,KV Cache传输占其端到端总延迟的43%-56%。
- 04PDD架构中,RLD实例仅承担6.2%的Token生成任务,93.8%的解码任务由远端MD实例完成,证明中继站未成为系统瓶颈。
- 05PDD采用Extend-Decode Handoff机制,RLD只传输极小的Token ID(几KB),MD端重算100个Token的KV Cache平均耗时仅305.2ms,远优于通过以太网传输KV Cache(平均185.4ms,峰值512.6ms且不可控)。
反方 / 局限
- — 实验结果中,RLD使用了3个旗舰GPU节点(运行DeepSeek-V4-pro的最小规模),若在更大规模部署中,RLD的固定开销将被进一步摊薄,性价比还有提升空间。
- — 由于与DRC存在暂时的兼容性问题,实验中未开启MTP等关键优化机制,开启后异构性价比还有进一步提升空间。
14 分钟 · 4 卡片 · 8 资料
读原文 →