科技智东西·程 茜··AI 生成
5050亿参数!余承东开源盘古新模型,“世界第一”还有些距离
华为开源了基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro,总参数5050亿,激活参数180亿,支持512K上下文。文章详细介绍了其分层混合注意力机制、Muon优化器、三头MTP等架构创新,以及为长上下文智能体任务设计的软硬协同体系。但技术报告未提供与第三方模型的直接对比,且在复杂软件工程任务上与顶尖模型存在差距,表明华为的“世界第一”目标仍有距离。适合关注国产大模型技术进展、AI基础设施自主化的读者。原文 ↗原文 ↗
核心观点
- ▍华为开源openPangu-2.0-Pro,旨在通过软硬协同设计专攻长上下文智能体任务,但距离“世界第一”仍有差距,尤其在复杂软件工程任务上表现不足。
- 01openPangu-2.0-Pro总参数5050亿,激活参数180亿,支持512K上下文,训练数据34T tokens。
- 02核心架构采用分层混合注意力机制:SWA(滑动窗口注意力)处理局部上下文,DSA(深度稀疏注意力)处理全局信息,以降低长序列推理开销。
- 03采用三头MTP(多Token预测)模块实现推理加速,并引入Muon优化器与流形约束超连接(mHC)提升收敛速度。
- 04训练数据分为三阶段:通用领域(25T tokens)、推理能力(8T tokens)、退火处理(1.4T tokens),以逐步提升模型能力。
- 05后训练采用三级流水线:监督微调、并行强化学习专家训练(分逻辑推理、通用问答、智能体、代码四大领域)、多专家在线策略蒸馏。
- 06在128K上下文下,Pro版本最低TPOT时延9.55ms,单卡NPU生成吞吐1326 token/s。
- 07技术报告未公开与第三方模型(如GPT-4、Claude)的对比结果,仅称“在通用能力、推理、智能体测试中表现优异”。
反方 / 局限
- — 文章承认openPangu-2.0在“处理复杂现实世界软件工程任务时,仍与顶尖模型存在明显差距”,未点名具体模型但暗示对标对象。
- — 技术报告未附上任何第三方模型对照数据,使得“出众的对标实力”这一说法缺乏可验证的量化支撑。
12 分钟 · 4 卡片 · 11 资料
读原文 →前置背景
平行视角
未来推演
延伸追问