7.2
深览指数
科技智东西·李水青··AI 生成

硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!

本文以2.8万亿参数的Kimi K3模型推理优化为焦点,对比了海外Inferact团队采用Google TPU v7的“巨内核”方案(单kernel装整个模型)与浪潮信息基于自主芯片超节点SD200 Ultra的“超级算子”方案。核心结论是:万亿级MoE模型推理瓶颈在于数据搬运和内存带宽而非算力,两条路线(极端算子融合与系统级紧耦合)殊途同归,均指向打破传统“一算子一kernel”的计算范式。文章还指出,本土算力在芯片性能与生态落后NVIDIA的约束下,系统级创新(如超节点互联、AI辅助算子优化)是确定性最高的追赶路径,对中国AI产业有重要参考价值。适合关注大模型推理部署、AI基础设施、芯片竞争格局的从业者和研究者阅读。原文 ↗

核心观点
  • ▍万亿参数MoE模型推理的真正瓶颈不在于算力,而在于数据搬运和内存带宽;HBM带宽需求约1.5TB/次前向,专家需要分布多芯片并触发超120次All-to-All通信(小算子kernel间产生大量计算空泡),导致实际速度远低于理论峰值。
  • ▍针对该问题,海内外两条技术路线均指向打破传统“一个算子对应一个kernel”的计算范式:一条是极端算子融合(Inferact的“巨内核”),另一条是系统级紧耦合+算子融合(浪潮信息的“超级算子”),二者殊途同归。
  1. 01海外Inferact团队于2026年9月23日开源tpu-megakernels方案,使用Google Pallas将K3的92个MoE层放进一个Pallas调用,在单kernel内完成整个解码过程,利用TPU v7的64 MiB VMEM和异步DMA机制实现低并发Decode吞吐709 tokens/s。
  2. 02浪潮信息于2026年9月21日发布元脑SD200 Ultra超节点AI服务器,通过128芯本土AI芯片紧耦合,单机承载Kimi K3,Token生成时延首破5.85毫秒;该方案将KDA、Gated MLA、MoE等基础算子融合为超级算子,算子数量降低10倍,模型推理性能提升3倍以上。
  3. 03浪潮信息在SD200 Ultra中引入“超级算子智能体”,采用“用K3优化K3”思路,由AI智能体自动生成通算融合、Tile级流水的超级算子,性能较此前再提升50%。
  4. 04浪潮信息采用Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算)双线策略:SD200 Ultra面向“向上”(前沿模型),HC2000多元算力机组面向“向广”(低价Token规模化),同等投资Token产能提升10倍。
  5. 05浪潮信息SD200 Ultra的3D Hyper Mesh架构提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒,通过对称内存技术实现GPU显存直连,AllReduce通信时间降低3.5倍。
反方 / 局限
  • — 浪潮信息方案依赖于自研超节点SD200 Ultra的紧耦合硬件系统(128芯本土芯片),其通用性和可移植性存疑——其他厂商或使用不同硬件栈的团队难以直接复用该算子融合方案。
  • — Inferact的megakernel方案极度依赖TPU v7的显存架构特性(64 MiB VMEM、显式控制生命周期),在NVIDIA GPU或其他AI芯片架构上难以直接复制,存在较强的平台绑定。
11 分钟 · 3 卡片 · 9 资料
读原文 →

前置背景

技术原理

未来推演