7.1
深览指数
科技智东西·程 茜··AI 生成

8位工程师花一年、耗资近千万的工作,这个开源AI系统7天搞定了

面壁智能与OpenBMB开源了AI优化系统ForgeStencil,能在1周内自动完成超100个真实工业与科学计算软件的Stencil算子优化,耗时从专家数周压缩到小时级别,研发效率提升约100倍。该系统通过Kernel Agent和App Agent两大Agent协同,实现从自动生成代码到真实应用部署的全自动闭环,无需人工介入优化决策。文章提供了详细的加速比数据,如对核反应堆中子学软件Minisweep加速5.78倍,对全球工业仿真库Hypre加速3.86倍。适合关注AI for Science、高性能计算、工业软件自动化的技术决策者与研发人员阅读。原文 ↗

核心观点
  • ForgeStencil 首次实现了 Stencil 算子优化从提出优化想法到应用无缝部署的全自动闭环,无需人类专家介入优化决策,将单个应用优化耗时从专家数周压缩到小时级别。
  • 该系统通过 Kernel Agent 和 App Agent 两大 Agent 协同,实现了从自动生成代码向自动研究优化、从局部算子提速向真实应用部署的进化。
  1. 01ForgeStencil 用时 1 周,完成了超 100 个真实应用软件的自动优化,这相当于每年投入约 4-8 个工程师,等效研发投入为 300 万~1000 万元。
  2. 02在同等硬件下的算子测试中,ForgeStencil 在 fp32 精度下获得几何平均 2.35 倍加速比,混合精度 (fp16) 下获得额外 1.95 倍提速。
  3. 03ForgeStencil 已在一批主流科学软件上实现端到端加速,包括对核反应堆中子学软件 Minisweep 加速 5.78 倍,对全球工业仿真库 Hypre 加速 3.86 倍,对雷达和芯片电磁仿真 gprMax/FDTD 加速 2.47 倍。
  4. 04此前 HPC 专家每人每年能精调的应用软件通常不超过 20 个,ForgeStencil 的研发吞吐提升约 1-2 个数量级,研发效率提升约 100 倍。
  5. 05ForgeStencil 的优化效率可以随着算力规模的加大并行放大,且大量并行的 Agent 可以共享知识库与经验。
反方 / 局限
  • 文章未提及任何反方观点或系统性局限,但隐含了一个前提:ForgeStencil 目前仅针对 Stencil 这一类计算模式,对于其他类型的 HPC 计算模式(如稀疏矩阵、FFT 等)是否有效,文中未涉及。
7 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问