AI-NEWS · 2026年 8月 5日

米泊智能开源 ForgeStencil

米泊智能开源 ForgeStencil:AI 自动优化百余项工业软件

米泊智能联合 OpenBMB 开源了 ForgeStencil,这套系统专门针对 Stencil(网格算子)进行 AI 自动优化。它实现了零人工干预的自动研究与部署,打破了以往必须依赖稀缺高性能计算(HPC)专家手动优化的行业壁垒。

关键性能数据

  • 优化效率提升:在单周内自动优化了 100+ 个真实的工业与科学计算软件。
  • 研发周期缩短:单应用优化时间从数天/周级缩短至 小时级,研发效率提升约 100 倍
  • 算力扩展性:优化效果随算力规模扩展而提升,摆脱了人力限制。

核心架构:双智能体(Dual Agent)驱动

系统完全由 AI 智能体自主决策,无需人类专家介入,包含两个核心角色:

  1. Kernel Agent(算子智能体)- “科学家”角色
    • 职责:负责算子锻造(Operator Forging)。
    • 功能:独立研究并合成高性能内核,为主流 Stencil 类型构建针对不同形状和精度要求的专用算子矩阵,将数学表达转化为逼近硬件极限的代码。
  2. App Agent(应用智能体)- “工程专家”角色
    • 职责:负责针对真实应用的定制化解决方案。
    • 功能:识别热点、建立 GPU 基线、验证集成方案,并利用应用自带的测试用例进行端到端评估。

实测对比与行业应用

ForgeStencil 不仅能在理想化基准测试中胜出,更能直接解决实际工业场景中的性能瓶颈。

1. 框架对比优势

通过与 Halide, Devito, EBISU, DRStencil, FlashFFTStencil 等知名框架同台竞技:

  • FP32 精度:几何平均加速 2.35 倍
  • 混合 FP16 精度:在 FP32 基础上再提升 1.95 倍 速度。
  • 变系数 Stencil(全形状):相比最佳基线仍保持 1.34 倍 的几何平均加速。

2. 真实工业软件加速效果

系统深入主流科学软件及权威基准,优化成果直接转化为生产力:

  • HYPRE(结构化多重网格求解器):加速 3.86 倍
  • MiniSweep(核反应堆中子输运):加速 5.78 倍
  • gprMax & FDTD(电磁仿真):加速 2.47 倍
  • RTM(油气地震成像逆时偏移):加速 1.81 倍
  • QuantLib(债券定价):加速 1.82 倍
  • 非笛卡尔 MRI 重建:加速 2.45 倍
  • 数字乳腺断层合成反投影:加速 1.63 倍

42% 的优化直接对应真实工业生产负载,覆盖油气公司、医疗设备厂商及气象部门的核心业务。

战略意义与长远影响

从“经验驱动”到“数据驱动”的范式转移

  • 打破知识孤岛:传统 HPC 优化依赖专家个人经验,难以传承与共享。ForgeStencil 通过大量并行智能体共享知识库,实现了经验的实时交换。
  • 集体智能进化:系统具备持续的自我迭代与进化能力,从单一代码生成迈向自动研究与优化,从局部算子加速迈向全流程应用部署。

推动高端制造升级

长期来看,该系统将为 CAE 仿真、地震成像、电磁学、流体力学等高端装备的数字基础提供自动优化支持,直接加速国产高端装备与能源勘探的制造升级进程。

开源与生态建设

  • 开源地址:GitHub
  • 合作邀请:米泊智能已向高性能计算学者、工业软件专业人士及开源开发者发出邀请,共同构建该生态。

火龙果频道