Orchard – 微軟研究院開源的 Agentic AI 建模框架

AI工具3天前發佈新公告 AI管理員
1 0

Orchard是什麼

Orchard 是微軟研究院推出的開源 Agentic AI 建模框架,核心爲基於 Kubernetes 的 Orchard Env 環境服務,支持跨域複用沙箱進行數據蒸餾、強化學習 rollout 與評估。框架已覆蓋軟件工程、瀏覽器導航和個人助理三大場景,並開源了訓練數據與評估方法。

Orchard – 微軟研究院開源的 Agentic AI 建模框架

Orchard的主要功能

  • 跨域統一環境服務: Orchard Env 提供沙箱生命週期管理、命令執行、文件 I/O、網絡策略與 REST API,一套基礎設施可支撐代碼、網頁、桌面、移動端及生產力工作流。
  • 三大領域訓練配方: Orchard-SWE 專攻代碼修復,Orchard-GUI 處理視覺網頁導航,Orchard-Claw 面向郵件、日曆等日常生產力任務,均提供完整的 SFT + RL 訓練流水線。
  • 真實 Harness 內訓練: 支持直接在 Codex、OpenClaw、ZeroClaw 等真實部署 harness 中完成端到端訓練與評估,消除訓練環境與部署環境之間的錯配。
  • 開源數據集與評估協議: 釋放 107K 條 SWE 軌跡與 3,070 條 GUI 多模態 rollout 數據,以及對應的評測基準與可復現配方。

Orchard的技術原理

  • Kubernetes-native 環境層: Orchard Env 作爲獨立服務運行,通過容器編排實現數千個隔離沙箱的並行創建與銷燬,平均命令執行延遲僅 0.28 秒,支持自動擴縮容與 Redis 分佈式鎖。
  • Credit-Assignment SFT: 在軟件工程領域,系統不丟棄部分失敗的軌跡,而是從有效片段中提取監督信號,將可用訓練數據量最大化。
  • Balanced Adaptive Rollout + 密集獎勵: 針對 RL 稀疏反饋問題,採用平衡自適應 rollout 捕獲稀少成功信號,並引入 on-policy 蒸餾與基於規則的流程獎勵模型,爲中間步驟提供密集指導。
  • Value Model 重排序: 利用 20 次歷史實驗的 rollout 軌跡訓練 4B 參數價值模型,在推理階段對多個候選解進行評分並選取最優,將 Orchard-SWE 從 69.7% 提升至 73.0%。
  • Harness-Agnostic 代理記錄: 輕量級代理記錄 harness 自身的模型調用並重構爲訓練樣本,使任何 RL 代碼庫均可對接任何 harness,無需修改環境鏡像。

Orchard – 微軟研究院開源的 Agentic AI 建模框架

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Orchard

  • 安裝 SDK: 執行 pip install -e "orchard_env[dev]" 安裝 Python SDK,配置 SANDBOX_BASE_URLSANDBOX_API_KEY 環境變量。
  • 快速調用沙箱: 使用 SandboxClient 上下文管理器創建沙箱並執行命令,支持同步與異步模式、文件讀寫、git patch 應用及 PTY 會話。
  • 部署編排器: 通過 Azure AKS 提供的四個腳本(provision、build、deploy、smoke-test)約 20 分鐘即可完成多副本編排器部署,也支持非 Azure 集羣。
  • 運行訓練配方: 參照 GitHub 倉庫中的 trainer/slime/ 目錄,在 Orchard Env 上執行 Orchard-SWE、Orchard-GUI 或 Orchard-Claw 的完整 SFT + RL 訓練流程。

Orchard的核心優勢

  • 小模型逼近大模型性能: Orchard-SWE 用約 3B 活躍參數在 SWE-bench Verified 上達到 73.0%,接近參數量 10 倍以上的前沿系統;Orchard-GUI 以 4B 參數在三大網頁基準平均達到 68.4%,媲美 OpenAI CUA 與 Gemini CUA。
  • 成本顯著降低: 相比 E2B、Daytona 等託管沙箱服務,Orchard Env 按需成本約爲 0.47 倍,Spot 實例成本僅爲 0.10 倍,約 10 倍價差。
  • 跨 Harness 泛化能力強: 同一環境層支持 ReACT、ZeroClaw、OpenClaw、Codex 等多種 harness,Orchard-Claw 在 ZeroClaw 下 pass@3 從 59.6% 提升至 73.9%。
  • 訓練數據高效: Orchard-GUI 僅用 400 條蒸餾演示與 2,200 條開放任務即達到開源最強網頁 Agent 水平,證明小數據量配合正確環境即可訓練出高能力模型。

Orchard的項目地址

  • 項目官網:https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
  • GitHub倉庫:https://github.com/microsoft/Orchard
  • HuggingFace模型庫:https://huggingface.co/datasets/microsoft/Orchard
  • arXiv技術論文:https://arxiv.org/pdf/2605.15040

Orchard的同類競品對比

維度 Orchard OpenHands
定位 微軟開源的跨域 Agentic 建模框架,覆蓋代碼、網頁、生產力三大場景 開源社區主導的軟件工程 Agent,專注代碼庫修復與開發任務
環境層 自研 Kubernetes-native 通用環境服務(Orchard Env),一套基礎設施跨域複用 依賴 Docker 容器化環境,針對代碼任務定製,難以直接遷移到網頁或桌面場景
訓練能力 內置完整 SFT + RL 訓練流水線,支持在 Codex、OpenClaw 等真實 harness 內直接訓練 主要提供推理與執行框架,訓練流水線需自行搭建,通常在簡化環境中進行
數據開源 開源 107K 條 SWE 軌跡、3,070 條 GUI 多模態 rollout 及完整評估協議 開源代碼與部分評測結果,但大規模訓練軌跡數據集未完整公開
模型效率 3B–35B 活躍參數即可在 SWE-bench 達到 73.0%,接近 10 倍參數量前沿模型 通常依賴 70B 級模型或 GPT-4 等商業 API 才能達到相近的 SWE-bench 成績
成本結構 自託管沙箱成本約爲商業服務的 10%–50%,支持 Spot 實例大幅降低訓練開銷 主要依賴雲服務器或商業 API,成本隨模型規模與調用量線性增長
Harness 支持 原生支持 ReACT、ZeroClaw、OpenClaw、Codex 等多種 harness 無縫切換 主要圍繞自身 harness 設計,切換外部 harness 需額外適配

Orchard的應用場景

  • 自動化軟件工程: 在真實代碼庫中自主診斷 Bug、編寫測試、生成補丁並通過驗證,適用於開源項目維護與企業內部代碼審查。
  • 智能網頁導航: 基於視覺理解自動操作瀏覽器完成訂票、購物、信息檢索等開放域任務,可作爲 RPA 替代方案。
  • 個人生產力助手: 跨郵件、日曆、文檔等工具執行復雜工作流,如自動安排會議、整理收件箱、生成報告。
  • Agent 研究基礎設施: 爲學術與工業研究團隊提供可復現、低成本的 Agent 訓練與評估平台,加速開源 Agentic AI 生態建設。
  • 跨域 Agent 能力遷移: 用統一環境層探索代碼、網頁、桌面操作之間的技能遷移與累積學習。
© 版權聲明

相關文章

暫無評論

暫無評論...