Orchard是什麼
Orchard 是微軟研究院推出的開源 Agentic AI 建模框架,核心爲基於 Kubernetes 的 Orchard Env 環境服務,支持跨域複用沙箱進行數據蒸餾、強化學習 rollout 與評估。框架已覆蓋軟件工程、瀏覽器導航和個人助理三大場景,並開源了訓練數據與評估方法。

Orchard的主要功能
- 跨域統一環境服務: Orchard Env 提供沙箱生命週期管理、命令執行、文件 I/O、網絡策略與 REST API,一套基礎設施可支撐代碼、網頁、桌面、移動端及生產力工作流。
- 三大領域訓練配方: Orchard-SWE 專攻代碼修復,Orchard-GUI 處理視覺網頁導航,Orchard-Claw 面向郵件、日曆等日常生產力任務,均提供完整的 SFT + RL 訓練流水線。
- 真實 Harness 內訓練: 支持直接在 Codex、OpenClaw、ZeroClaw 等真實部署 harness 中完成端到端訓練與評估,消除訓練環境與部署環境之間的錯配。
- 開源數據集與評估協議: 釋放 107K 條 SWE 軌跡與 3,070 條 GUI 多模態 rollout 數據,以及對應的評測基準與可復現配方。
Orchard的技術原理
- Kubernetes-native 環境層: Orchard Env 作爲獨立服務運行,通過容器編排實現數千個隔離沙箱的並行創建與銷燬,平均命令執行延遲僅 0.28 秒,支持自動擴縮容與 Redis 分佈式鎖。
- Credit-Assignment SFT: 在軟件工程領域,系統不丟棄部分失敗的軌跡,而是從有效片段中提取監督信號,將可用訓練數據量最大化。
- Balanced Adaptive Rollout + 密集獎勵: 針對 RL 稀疏反饋問題,採用平衡自適應 rollout 捕獲稀少成功信號,並引入 on-policy 蒸餾與基於規則的流程獎勵模型,爲中間步驟提供密集指導。
- Value Model 重排序: 利用 20 次歷史實驗的 rollout 軌跡訓練 4B 參數價值模型,在推理階段對多個候選解進行評分並選取最優,將 Orchard-SWE 從 69.7% 提升至 73.0%。
- Harness-Agnostic 代理記錄: 輕量級代理記錄 harness 自身的模型調用並重構爲訓練樣本,使任何 RL 代碼庫均可對接任何 harness,無需修改環境鏡像。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Orchard
- 安裝 SDK: 執行
pip install -e "orchard_env[dev]"安裝 Python SDK,配置SANDBOX_BASE_URL與SANDBOX_API_KEY環境變量。 - 快速調用沙箱: 使用
SandboxClient上下文管理器創建沙箱並執行命令,支持同步與異步模式、文件讀寫、git patch 應用及 PTY 會話。 - 部署編排器: 通過 Azure AKS 提供的四個腳本(provision、build、deploy、smoke-test)約 20 分鐘即可完成多副本編排器部署,也支持非 Azure 集羣。
- 運行訓練配方: 參照 GitHub 倉庫中的
trainer/slime/目錄,在 Orchard Env 上執行 Orchard-SWE、Orchard-GUI 或 Orchard-Claw 的完整 SFT + RL 訓練流程。
Orchard的核心優勢
- 小模型逼近大模型性能: Orchard-SWE 用約 3B 活躍參數在 SWE-bench Verified 上達到 73.0%,接近參數量 10 倍以上的前沿系統;Orchard-GUI 以 4B 參數在三大網頁基準平均達到 68.4%,媲美 OpenAI CUA 與 Gemini CUA。
- 成本顯著降低: 相比 E2B、Daytona 等託管沙箱服務,Orchard Env 按需成本約爲 0.47 倍,Spot 實例成本僅爲 0.10 倍,約 10 倍價差。
- 跨 Harness 泛化能力強: 同一環境層支持 ReACT、ZeroClaw、OpenClaw、Codex 等多種 harness,Orchard-Claw 在 ZeroClaw 下 pass@3 從 59.6% 提升至 73.9%。
- 訓練數據高效: Orchard-GUI 僅用 400 條蒸餾演示與 2,200 條開放任務即達到開源最強網頁 Agent 水平,證明小數據量配合正確環境即可訓練出高能力模型。
Orchard的項目地址
- 項目官網:https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
- GitHub倉庫:https://github.com/microsoft/Orchard
- HuggingFace模型庫:https://huggingface.co/datasets/microsoft/Orchard
- arXiv技術論文:https://arxiv.org/pdf/2605.15040
Orchard的同類競品對比
| 維度 | Orchard | OpenHands |
|---|---|---|
| 定位 | 微軟開源的跨域 Agentic 建模框架,覆蓋代碼、網頁、生產力三大場景 | 開源社區主導的軟件工程 Agent,專注代碼庫修復與開發任務 |
| 環境層 | 自研 Kubernetes-native 通用環境服務(Orchard Env),一套基礎設施跨域複用 | 依賴 Docker 容器化環境,針對代碼任務定製,難以直接遷移到網頁或桌面場景 |
| 訓練能力 | 內置完整 SFT + RL 訓練流水線,支持在 Codex、OpenClaw 等真實 harness 內直接訓練 | 主要提供推理與執行框架,訓練流水線需自行搭建,通常在簡化環境中進行 |
| 數據開源 | 開源 107K 條 SWE 軌跡、3,070 條 GUI 多模態 rollout 及完整評估協議 | 開源代碼與部分評測結果,但大規模訓練軌跡數據集未完整公開 |
| 模型效率 | 3B–35B 活躍參數即可在 SWE-bench 達到 73.0%,接近 10 倍參數量前沿模型 | 通常依賴 70B 級模型或 GPT-4 等商業 API 才能達到相近的 SWE-bench 成績 |
| 成本結構 | 自託管沙箱成本約爲商業服務的 10%–50%,支持 Spot 實例大幅降低訓練開銷 | 主要依賴雲服務器或商業 API,成本隨模型規模與調用量線性增長 |
| Harness 支持 | 原生支持 ReACT、ZeroClaw、OpenClaw、Codex 等多種 harness 無縫切換 | 主要圍繞自身 harness 設計,切換外部 harness 需額外適配 |
Orchard的應用場景
- 自動化軟件工程: 在真實代碼庫中自主診斷 Bug、編寫測試、生成補丁並通過驗證,適用於開源項目維護與企業內部代碼審查。
- 智能網頁導航: 基於視覺理解自動操作瀏覽器完成訂票、購物、信息檢索等開放域任務,可作爲 RPA 替代方案。
- 個人生產力助手: 跨郵件、日曆、文檔等工具執行復雜工作流,如自動安排會議、整理收件箱、生成報告。
- Agent 研究基礎設施: 爲學術與工業研究團隊提供可復現、低成本的 Agent 訓練與評估平台,加速開源 Agentic AI 生態建設。
- 跨域 Agent 能力遷移: 用統一環境層探索代碼、網頁、桌面操作之間的技能遷移與累積學習。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...