7.2
深览指数
科技量子位·思邈··AI 生成

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

无问芯穹在2026 WAIC上公布了跨集群异构推理架构PDD,通过将传统的PD分离解构为P-RLD-MD三级架构,利用同集群的RLD实例作为“中继站”,掩盖了跨集群以太网传输KV Cache的延迟。实测显示,该架构在首Token延迟降低51.5%的同时,单Token成本降低37.5%。文章详细阐述了其核心洞察(硬件“偏科”、DRC缓存、请求命中率分布偏斜)与创新机制(Extend-Decode交接),证明通过极小的本地算力开销,即可盘活散落各地的存量异构算力。适合对AI推理系统架构、大模型工程化部署与成本优化有深入兴趣的技术决策者与工程师阅读。原文 ↗

核心观点
  • 通过引入中继(RLD)实例,PDD架构能以极小的本地算力开销,近乎完美地掩盖跨集群以太网传输KV Cache的延迟,实现低成本、高性价比的跨集群异构推理。
  1. 01硬件性能极度偏科:某厂商E芯片在Decode阶段的性能是旗舰GPU的210%,但在Prefill阶段仅为81%。
  2. 02利用Agent业务前缀缓存命中率高的特点,DRC技术可将跨集群带宽需求降低10倍。
  3. 03真实业务请求命中率分布极度偏斜:70%-80%的请求命中率在95%以上,仅极少数低命中率请求携带巨大KV Cache。
  4. 04PDD核心机制:P端通过同机房RDMA将KV Cache快速传给RLD,RLD立即开始解码,同时通过低速以太网将KV Cache传给远端MD,MD准备好后通过“只传Token ID”的Extend-Decode方式接管任务。
  5. 05MD端重算100个Token的KV Cache平均耗时仅305.2ms,最大延迟321.4ms,远优于以太网传输的波动与长尾延迟。
  6. 06RLD仅承担系统6.2%的Token生成任务,93.8%由远端MD实例完成。
  7. 07在P90 TTFT ≤ 10s的约束下,PDD相比同构单机房部署,总成本降低约3.5%-7.1%,有效吞吐量提升27.8%,性价比(BCR)提升37.5%。
反方 / 局限
  • 文章指出,RLD实例使用了3个旗舰GPU作为最小样本,若在更大规模部署中,其固定开销将被进一步摊薄,暗示当前小规模测试可能未完全体现其成本优势。
  • 实验因与DRC存在兼容性问题,未开启MTP等关键优化机制,表明当前性能数据仍有提升空间,也暗示了架构实现的复杂性。
19 分钟 · 5 卡片 · 13 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问