ForgeStencil – 面壁智能推出的 Stencil 全自動研究部署系統

AI工具1個月前發佈新公告 AI管理員
0 0

ForgeStencil是什麼

ForgeStencil 是面壁智能聯合 OpenBMB 開源社區推出的全球首個支持 Stencil 自動研究、自動部署的 AI 優化系統,基於 Kernel Agent 與 App Agent 雙智能體閉環,實現從優化策略發現到真實生產軟件集成的全流程零人工介入。系統在一週內完成 100 餘個工業與科學計算軟件的端到端優化,中位加速 1.41 倍,覆蓋油氣勘探、電磁仿真、醫學影像等 8 大工業領域與 5 大科學領域。

ForgeStencil – 面壁智能推出的 Stencil 全自動研究部署系統

ForgeStencil的主要功能

  • 雙 Agent 閉環優化:Kernel Agent 自主研究併合成高性能 CUDA Kernel,App Agent 完成熱點定位、算子鍛造、正確性驗證與應用集成。
  • 自動策略發現:Agent 自主探索分塊、融合、佈局、佔用率及主機端重構等優化策略,而非在固定空間內搜索。
  • 真實應用部署:直接面向生產級軟件優化,以應用自身 GPU 代碼爲基線進行端到端驗證,非簡化 Benchmark。
  • 可審計測量協議:通過單一環境開關在原始路徑與優化路徑間交錯切換,使用程序自帶檢查與計時器,確保加速比真實可信。
  • 跨代 GPU 適配:支持 A100/H100/B200 運行時架構分發,同一代碼庫按架構自動選擇最優 Kernel 路徑。

ForgeStencil的技術原理

  • 雙 Agent 協同架構:系統由 Kernel Agent 與 App Agent 組成閉環。Kernel Agent 負責理論發現,通過 Plan→Code→Profile 循環自主研究併合成逼近硬件物理極限的 Stencil 算子;App Agent 負責工程落地,定位應用性能熱點、建立 GPU 基線、調用 Kernel Agent 構建的算子矩陣知識庫鍛造應用專屬優化,完成正確性驗證與原應用集成。
  • 算子矩陣與知識庫進化:Kernel Agent 在優化過程中持續構建專用算子矩陣作爲知識庫,後續 App Agent 可複用已有技術;多並行 Agent 共享該知識庫,實現經驗的實時共享與集體同步進化,突破人類專家經驗難以規模化傳遞的瓶頸。
  • 可審計端到端協議:測量以應用自身的生產級 GPU 實現爲唯一基線,原始路徑與優化路徑僅通過單一 USE_OURS 開關區分,且原始路徑與上游字節一致;使用程序內置的正確性檢查和計時器,在多輪交錯運行後取中位數,最終報告所有標準用例的幾何平均加速比,從系統層面杜絕造假空間。
  • Patch 模式與零源碼捆綁:不捆綁任何第三方源碼,每個應用僅提供上游出處記錄、獲取腳本和集成補丁,通過 vendor.sh 自動拉取指定版本上游代碼,確保許可證清潔與結果可復現。

ForgeStencil – 面壁智能推出的 Stencil 全自動研究部署系統

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用ForgeStencil

  • 環境準備:克隆倉庫並確保具備 NVIDIA GPU(A100 驗證)、CUDA 12.x、C++17 編譯器及 Python 3.9+ 環境。
  • 快速體驗算子:運行 python tools/run.py --stencil star_1 --shape 256 --gpu 0 即可在 1 分鐘內測量單算子性能並與 Halide 基線對比。
  • 端到端復現:進入目標應用目錄執行 ./vendor.sh 拉取上游源碼,應用集成補丁後運行 python ../../harness/run_e2e.py --app <name> --gpu auto 完成真實應用驗證。
  • 驅動 Agent 工作:參考 agents/README.md 配置並啓動 Kernel Agent 與 App Agent 的自主優化循環。
  • 查閱結果註冊表:通過 results/integration_registry.json 查看 100 個已驗證應用的審計加速比數據。

ForgeStencil的核心優勢

  • 零人工介入:從應用分析、熱點定位、Kernel 鍛造到集成驗證全流程自動化,無需 HPC 專家參與決策。
  • 真實場景導向:直接優化生產級工業軟件,42% 爲真實工業生產軟件,基線爲應用自身 GPU 代碼。
  • 研發效率飛躍:單應用優化從數月縮短至一天內,一週完成 100+ 應用,等效節省約 20–30 人年研發投入。
  • 性能表現強勁:端到端中位加速 1.41 倍,43% 應用 ≥1.5 倍,算子級幾何平均 2.16 倍領先最優開源基線。
  • 跨架構可持續:支持多代 NVIDIA GPU 運行時分發,架構升級時可自動重鍛 Kernel 以捕獲新硬件特性。

ForgeStencil的項目地址

  • GitHub倉庫:https://github.com/OpenBMB/ForgeStencil

ForgeStencil的同類競品對比

維度 ForgeStencil Halide
優化策略來源 Agent 自主發現新策略,非固定空間搜索 人類設計 DSL 與調度策略,自動化受限於預設規則
部署範圍 支持真實應用端到端集成與驗證 主要面向單算子/圖像處理管線,缺乏應用級自動部署
基線對比 以應用自身生產 GPU 代碼爲基準 通常以簡化參考實現或 CPU 版本爲基準
正確性驗證 使用程序自帶檢查,交錯測量確保可信 依賴框架內置測試,無系統級防造假協議
知識積累 多 Agent 共享算子矩陣知識庫,經驗可複用 優化經驗分散於各專家,難以規模化傳遞

ForgeStencil的應用場景

  • 油氣地震勘探:優化 RTM 逆時偏移、道達爾 mini-app 等核心算法,加速石油勘探數據處理流程。
  • 電磁仿真設計:提升 gprMax/FDTD 等 Yee 網格 Maxwell 方程求解效率,服務於雷達與芯片電磁分析。
  • 醫學影像重建:加速非笛卡爾 MRI 重建、數字乳腺斷層成像反投影等醫療影像計算負載。
  • 氣候與天體物理:優化大氣動力學、宇宙學模擬等 Stencil 密集型科學計算應用。
  • 量化金融計算:爲 QuantLib 等金融機構定價庫提供 Stencil 熱點自動優化,降低交易計算時延。
© 版權聲明

相關文章

暫無評論

暫無評論...