HarnessEval是什麼
HarnessEval 是 MirroS 聯合清北、Berkeley、MIT、英偉達等機構推出的評測系統。HarnessEval將評測本身 Agent 化。面對每個案例,系統動態規劃評測路徑,從 Skill Library 選擇適用技能,拆解爲可驗證的子問題,調用工具蒐集證據,最終輸出可追溯的 evidence tree。HarnessEval突破傳統靜態 benchmark 的侷限,讓評測從黑盒分數變成可解釋、可復現的智能工作流。首個落地項目 HarnessEval-W 已用於交互式世界模型評測。

HarnessEval的主要功能
-
動態評測規劃:針對每個案例的上下文與目標,自動生成定製化評測計劃。
-
技能路由:從 Skill Library 中按需選擇適用技能,而非跑完所有固定指標。
-
問題拆解:將抽象評測問題拆分爲可測量、可驗證的子問題。
-
證據蒐集:調用 sub-agent 和診斷工具,從不同角度蒐集視覺與邏輯證據。
-
證據驗證:主智能體驗證各分支證據的質量與邏輯關係,確保結論可靠。
-
Evidence Tree 輸出:輸出完整證據樹,記錄測試內容、工具調用、推理鏈與最終分數。
-
可擴展 Skill Library:內置 9 個核心技能模塊,支持隨模型演進動態添加新技能。
-
評測案例自動構建:基於場景分類學自動生成初始世界、動作與驗證,確保評測質量。
HarnessEval的技術原理
- 四層 Agentic 工作流:HarnessEval 採用 Plan-Router-Decompose-Verify 四層工作流:Plan 階段理解案例上下文並生成定製化評測計劃;Route 階段從 Skill Library 中動態選擇適用技能;Decompose 階段將高層問題拆分爲子問題並委派給 sub-agent;Verify 階段由主智能體驗證證據質量與邏輯關係,形成最終結論。
- 分層智能體架構:系統採用主智能體統籌規劃與驗證,各 Skill Agent 負責專項評測,每個 Skill 再進一步拆分爲多個 sub-agent 處理具體子任務,形成層級化的評測執行結構。
- 可擴展 Skill Library:框架內置 9 個核心技能模塊,覆蓋渲染質量、物理合理性、狀態變化驗證、漂移分析、重訪一致性、離屏演化等維度,並支持隨模型能力演進動態添加新技能,實現評測能力的持續擴展。
- Evidence Tree 輸出機制:評測結果以層級式證據樹形式呈現,完整記錄測試內容、工具調用、視覺證據與推理鏈,使評測結論可檢查、可復現、可追責,而非僅輸出單一標量分數。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用HarnessEval
-
克隆倉庫:從 GitHub 拉取 HarnessEval-W 代碼庫。
-
創建環境:分別創建
harnesseval-main、harnesseval-metrics和harnesseval-pavrm三個 conda 環境。 -
配置憑證:複製
config/example.env爲harnesseval.env並加載環境變量。 -
準備數據:將待評測模型生成的視頻結果放入指定目錄,並準備好
manifest.json清單文件。 -
執行評測:運行
harnesseval eval命令,指定模型結果路徑、評測計劃和輸出目錄。 -
驗證結果:運行
harnesseval verify run檢查評測輸出是否完整、分數是否生成。 -
查看報告:在輸出目錄中查看
summary.json、leaderboard_latest.csv和LEADERBOARD.md獲取詳細評分與排名。
HarnessEval的核心優勢
-
動態評測規劃:針對每個案例的上下文自動生成定製化評測計劃,而非套用固定流程。
-
智能技能路由:從 Skill Library 中按需選擇適用技能,避免對所有案例跑完無關指標。
-
可解釋的證據鏈:輸出完整的 Evidence Tree,可追溯每項分數背後的工具調用、視覺證據與推理邏輯。
-
可擴展的技能庫:Skill Library 支持動態添加新技能,隨模型能力演進持續擴展評測維度。
-
分層智能體協作:主智能體統籌規劃與驗證,sub-agent 分工處理子問題,實現複雜評測任務的精細化拆解。
-
評測數據自動生成:基於場景分類學自動構建初始世界、動作與驗證,確保評測案例的質量與多樣性。
-
評測過程透明可審計:完整的推理鏈與證據記錄使評測結論可檢查、可復現、可追責。
-
貼近人類評測方式:模擬人類專家”理解—規劃—取證—推理”的評測工作流,而非機械打分。
HarnessEval的項目地址
- 項目官網:https://mirros.ai/blog/harnesseval
- GitHub倉庫:https://github.com/mirros-lab/harnesseval-w
HarnessEval的同類競品對比
| 對比維度 | HarnessEval | VBench |
|---|---|---|
| 評測對象 | 交互式世界模型(帶動作輸入、狀態轉移、物理因果) | 視頻生成模型(單場景、無交互輸入) |
| 評測方式 | Agentic 動態工作流:Plan → Route → Decompose → Verify | 固定指標流水線:預設 rubric + 批量打分 |
| 技能選擇 | 根據案例上下文動態路由 Skill Library 中的技能 | 所有案例跑完同一套固定指標 |
| 問題拆解 | 將高層評測問題拆分爲可測量的子問題,委派 sub-agent | 直接計算指標,無層級拆解 |
| 輸出形式 | Evidence Tree(證據樹):記錄測試內容、工具調用、推理鏈、分數依據 | 標量分數 + 各維度柱狀圖 |
| 可解釋性 | 可追溯每項分數的完整推理鏈與視覺證據 | 僅輸出分數,無法解釋”爲什麼低分” |
| 可擴展性 | Skill Library 可動態添加新技能,支持遞歸自我改進 | 指標固定,擴展需修改整體框架 |
| 物理因果 | 專門評估狀態轉移正確性、物理合理性、世界持續性 | 僅評估視覺質量與運動流暢度 |
HarnessEval的應用場景
-
交互式世界模型評測:評估視頻生成模型在動作條件下的狀態轉移正確性、物理合理性與世界持續性。
-
具身智能與機器人仿真:評測機器人在虛擬環境中的操控能力、物理交互因果與長期狀態一致性。
-
自動駕駛世界模型:驗證生成場景中的相機軌跡遵循、物體 permanence、離屏演化與物理動力學合理性。
-
遊戲與虛擬世界生成:評估開放世界遊戲的場景一致性、NPC 行爲因果、重訪一致性與視覺質量。
-
物理仿真與科學計算:檢驗生成視頻中的物理定律遵循與因果保真度。
-
AI 視頻創作平台:爲 Seedance、Kling、Sora 等模型提供可解釋的質量診斷,定位具體失敗模式(如額外事件、目標漂移、物理違規)。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...