7.2
深览指数
科技智东西·陈 骏达··AI 生成

一文看懂昇腾超节点:AI Infra已进入系统工程阶段

本文深度解析了华为昇腾960超节点的工程方案与行业价值。核心结论是:随着大模型迈向10万卡集群,卡间通信损耗(仿真显示可达40%训练时间)成为有效算力瓶颈,超节点通过紧密互联与统一内存编址,将数千张卡组织成逻辑上的“一台计算机”,可将MFU提升至传统集群的2.75倍。文章详细拆解了实现这一目标的三大技术支柱:Hi-ONE近封装光学(NPO)光引擎(单个替代9个800G光模块)、灵衢UnifiedBus统一互联协议(支持至多100万卡集群)、以及全液冷正交架构。适合关注AI Infra工程落地、算力效率及华为技术路线的从业者阅读。原文 ↗

核心观点
  • 在10万卡AI集群中,卡间通信损耗成为主要瓶颈,超节点(将千卡级计算单元通过高效互联与统一内存编址组织成逻辑实体)是提升算力利用率(MFU)的必然选择。
  • AI基础设施的竞争已进入多学科系统工程的阶段,华为“计算+通信”的全栈能力(从NPU到光引擎到互联协议)是其核心竞争优势。
  1. 01华为仿真数据显示,在10万卡集群中,卡间通信可能消耗了40%以上的训练时间,算力利用率(MFU)不到30%。
  2. 02《超节点定义与实践白皮书》(鹏城实验室与GCC牵头,38家单位参与)明确超节点需具备高效互联协议与跨物理节点统一内存编址能力,逻辑上具有“一台计算机”的特征。
  3. 03华为马尔科夫实验室仿真显示,由4000卡超节点组成的10万卡系统,MFU可达传统8卡服务器集群的2.75倍。
  4. 04华为Hi-ONE是业界首个量产的NPO产品,拥有7.2Tb/s带宽(集成36个200G Lane),单个模块可替代9个800G光模块,将超节点内互联器件数量降至约1/9。
  5. 05昇腾960超节点采用“灵衢+Hi-ONE”正交架构与全液冷设计,将4096颗算力卡逻辑融合,提供8EFLOPS FP8/16EFLOPS FP4算力及最高1PB HBM容量,RTT时延最低2微秒。
  6. 06基于灵衢协议和二阶CLOS四平面组网,昇腾960超节点集群最大可支持51.2万卡,结合多轨道拓扑可支持100万卡。
  7. 07新升级的鲲鹏超节点基于灵衢全光组网,最大支持4096节点形成256TB统一内存池,在Agent场景下十万级沙箱启动相比传统提升30倍。
反方 / 局限
  • 文章提及NPO技术当前面临标准缺位问题,各厂商方案互不兼容,产业链难以分工放量导致成本居高不下,虽华为已推动OIF标准立项,但产业成熟仍需时间。
  • 文章未明确讨论超节点方案相对于其他主流方案(如英伟达NVLink、谷歌TPU Pod)的优劣势对比,也未点出华为方案在生态兼容性和软件栈成熟度上的潜在风险。
13 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问