HarnessEval – MirroS 聯合清北、英偉達等推出的評測系統

AI工具3周前發佈新公告 AI管理員
0 0

HarnessEval是什麼

HarnessEval 是 MirroS 聯合清北、Berkeley、MIT、英偉達等機構推出的評測系統。HarnessEval將評測本身 Agent 化。面對每個案例,系統動態規劃評測路徑,從 Skill Library 選擇適用技能,拆解爲可驗證的子問題,調用工具蒐集證據,最終輸出可追溯的 evidence tree。HarnessEval突破傳統靜態 benchmark 的侷限,讓評測從黑盒分數變成可解釋、可復現的智能工作流。首個落地項目 HarnessEval-W 已用於交互式世界模型評測。

HarnessEval – MirroS 聯合清北、英偉達等推出的評測系統

HarnessEval的主要功能

  • 動態評測規劃:針對每個案例的上下文與目標,自動生成定製化評測計劃。
  • 技能路由:從 Skill Library 中按需選擇適用技能,而非跑完所有固定指標。
  • 問題拆解:將抽象評測問題拆分爲可測量、可驗證的子問題。
  • 證據蒐集:調用 sub-agent 和診斷工具,從不同角度蒐集視覺與邏輯證據。
  • 證據驗證:主智能體驗證各分支證據的質量與邏輯關係,確保結論可靠。
  • Evidence Tree 輸出:輸出完整證據樹,記錄測試內容、工具調用、推理鏈與最終分數。
  • 可擴展 Skill Library:內置 9 個核心技能模塊,支持隨模型演進動態添加新技能。
  • 評測案例自動構建:基於場景分類學自動生成初始世界、動作與驗證,確保評測質量。

HarnessEval的技術原理

  • 四層 Agentic 工作流:HarnessEval 採用 Plan-Router-Decompose-Verify 四層工作流:Plan 階段理解案例上下文並生成定製化評測計劃;Route 階段從 Skill Library 中動態選擇適用技能;Decompose 階段將高層問題拆分爲子問題並委派給 sub-agent;Verify 階段由主智能體驗證證據質量與邏輯關係,形成最終結論。
  • 分層智能體架構:系統採用主智能體統籌規劃與驗證,各 Skill Agent 負責專項評測,每個 Skill 再進一步拆分爲多個 sub-agent 處理具體子任務,形成層級化的評測執行結構。
  • 可擴展 Skill Library:框架內置 9 個核心技能模塊,覆蓋渲染質量、物理合理性、狀態變化驗證、漂移分析、重訪一致性、離屏演化等維度,並支持隨模型能力演進動態添加新技能,實現評測能力的持續擴展。
  • Evidence Tree 輸出機制:評測結果以層級式證據樹形式呈現,完整記錄測試內容、工具調用、視覺證據與推理鏈,使評測結論可檢查、可復現、可追責,而非僅輸出單一標量分數。

HarnessEval – MirroS 聯合清北、英偉達等推出的評測系統

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用HarnessEval

  • 克隆倉庫:從 GitHub 拉取 HarnessEval-W 代碼庫。
  • 創建環境:分別創建 harnesseval-main、harnesseval-metrics 和 harnesseval-pavrm 三個 conda 環境。
  • 配置憑證:複製 config/example.env 爲 harnesseval.env 並加載環境變量。
  • 準備數據:將待評測模型生成的視頻結果放入指定目錄,並準備好 manifest.json 清單文件。
  • 執行評測:運行 harnesseval eval 命令,指定模型結果路徑、評測計劃和輸出目錄。
  • 驗證結果:運行 harnesseval verify run 檢查評測輸出是否完整、分數是否生成。
  • 查看報告:在輸出目錄中查看 summary.json、leaderboard_latest.csv 和 LEADERBOARD.md 獲取詳細評分與排名。

HarnessEval的核心優勢

  • 動態評測規劃:針對每個案例的上下文自動生成定製化評測計劃,而非套用固定流程。
  • 智能技能路由:從 Skill Library 中按需選擇適用技能,避免對所有案例跑完無關指標。
  • 可解釋的證據鏈:輸出完整的 Evidence Tree,可追溯每項分數背後的工具調用、視覺證據與推理邏輯。
  • 可擴展的技能庫:Skill Library 支持動態添加新技能,隨模型能力演進持續擴展評測維度。
  • 分層智能體協作:主智能體統籌規劃與驗證,sub-agent 分工處理子問題,實現複雜評測任務的精細化拆解。
  • 評測數據自動生成:基於場景分類學自動構建初始世界、動作與驗證,確保評測案例的質量與多樣性。
  • 評測過程透明可審計:完整的推理鏈與證據記錄使評測結論可檢查、可復現、可追責。
  • 貼近人類評測方式:模擬人類專家”理解—規劃—取證—推理”的評測工作流,而非機械打分。

HarnessEval的項目地址

  • 項目官網:https://mirros.ai/blog/harnesseval
  • GitHub倉庫:https://github.com/mirros-lab/harnesseval-w

HarnessEval的同類競品對比

對比維度 HarnessEval VBench
評測對象 交互式世界模型(帶動作輸入、狀態轉移、物理因果) 視頻生成模型(單場景、無交互輸入)
評測方式 Agentic 動態工作流:Plan → Route → Decompose → Verify 固定指標流水線:預設 rubric + 批量打分
技能選擇 根據案例上下文動態路由 Skill Library 中的技能 所有案例跑完同一套固定指標
問題拆解 將高層評測問題拆分爲可測量的子問題,委派 sub-agent 直接計算指標,無層級拆解
輸出形式 Evidence Tree(證據樹):記錄測試內容、工具調用、推理鏈、分數依據 標量分數 + 各維度柱狀圖
可解釋性 可追溯每項分數的完整推理鏈與視覺證據 僅輸出分數,無法解釋”爲什麼低分”
可擴展性 Skill Library 可動態添加新技能,支持遞歸自我改進 指標固定,擴展需修改整體框架
物理因果 專門評估狀態轉移正確性、物理合理性、世界持續性 僅評估視覺質量與運動流暢度

HarnessEval的應用場景

  • 交互式世界模型評測:評估視頻生成模型在動作條件下的狀態轉移正確性、物理合理性與世界持續性。
  • 具身智能與機器人仿真:評測機器人在虛擬環境中的操控能力、物理交互因果與長期狀態一致性。
  • 自動駕駛世界模型:驗證生成場景中的相機軌跡遵循、物體 permanence、離屏演化與物理動力學合理性。
  • 遊戲與虛擬世界生成:評估開放世界遊戲的場景一致性、NPC 行爲因果、重訪一致性與視覺質量。
  • 物理仿真與科學計算:檢驗生成視頻中的物理定律遵循與因果保真度。
  • AI 視頻創作平台:爲 Seedance、Kling、Sora 等模型提供可解釋的質量診斷,定位具體失敗模式(如額外事件、目標漂移、物理違規)。
© 版權聲明

相關文章

暫無評論

暫無評論...