7.0
深览指数
科技微博·机器之心Pro··AI 生成

万卡国产训推之后,科大讯飞开始让AI反哺算力

科大讯飞发布星火X2.5模型(293B-A30B MoE),该模型在万卡国产昇腾910B集群上完成训推,并通过技术优化解决了万卡训练中的算子效率、长上下文处理、通信瓶颈和稳定性四大工程挑战。文章的核心价值在于揭示了AI模型开始反向参与底层NPU算子优化的新趋势,形成“算力训练模型、模型优化算力”的反馈闭环。适合关注国产AI芯片落地、大模型工程化及软硬件协同优化的技术决策者与从业者阅读。原文 ↗

核心观点
  • 国产AI算力正从单纯的“训推适配”阶段演进,模型自身开始参与底层NPU算子优化,形成“算力训练模型→模型优化算力”的强化反馈循环,这会沉淀为长期的工程优势。
  1. 01星火X2.5(293B-A30B MoE)在万卡国产昇腾910B集群上完成预训练和后训练,线上推理也基于国产平台。
  2. 02针对长序列训练,星火X2.5采用结合动态负载均衡的长序列并行方案,使长文本训练效率相对提升30%以上。
  3. 03针对超长序列通信开销,引入通信压缩、分层通信和计算并行等方式,相关训练效率提升10%。
  4. 04在训练稳定性方面,机器有效训练时长超过97%,实现了训前校验、训中卡死检测、失败任务自动重提、故障时进程级快速恢复等。
  5. 05星火X2.5通过在GitCode昇腾算子仓库构建训练语料,学习CANN编程规范,并在真实NPU环境中进行多轮迭代优化。
  6. 06在具体的DSA细粒度稀疏注意力算子优化案例中,星火X2.5通过约1600次工具调用,在昇腾910B上相比torch_npu实现获得3.5倍加速。
  7. 07星火X2.5在Terminal Bench、SWE Pro、SWE Verified等多项代码与智能体测试上表现突出,能完成从自然语言需求到完整网页或交互应用的生成。
反方 / 局限
  • 模型参与算子优化当前仍需要预设任务目标、初始代码、硬件环境和评估脚本,其作用是提高特定环节的自动化程度,并非完全独立的底层系统开发。
  • 国产芯片在计算架构、编程接口等方面存在差异,星火X2.5的优化经验迁移到寒武纪、中科海光等其他平台时,仍需重新处理算子实现和工具链衔接。
12 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问