E-Bench – 騰訊混元等推出的智能體評測基準

AI工具4天前發佈新公告 AI管理員
0 0

E-Bench是什麼

E-Bench 是騰訊混元團隊聯合清華大學 AIR、東南大學推出的多步驟工具使用評測基準,基於王者榮耀、QQ 音樂、騰訊會議三大真實產品爲原型,構建全合成虛擬環境,包含 323 個狀態變更任務、41 張數據庫表及超 7.6 萬條數據。通過信息鴻溝與工具鴻溝雙不對稱設計,迫使智能體主動蒐集隱藏信息並編排多步工具調用,最終用確定性數據庫狀態 diff 評分,揭示當前 AI 智能體在真實產品場景中的能力邊界。

E-Bench – 騰訊混元等推出的智能體評測基準

E-Bench的主要功能

  • 全合成產品環境構建:基於圖引導的數據庫填充技術,生成無孤立記錄、跨表一致的三大產品虛擬世界。
  • 雙鴻溝任務生成:出題模型擁有完整數據庫訪問權,被測模型僅能通過受限業務工具交互,製造信息與工具雙重不對稱。
  • 確定性狀態評測:用數據庫操作前後的狀態 diff 作爲唯一評判標準,精確匹配才計通過,杜絕部分分與裁判方差。
  • 成本性能聯合分析:同步記錄每任務 API 開銷,繪製準確率與成本的帕累託前沿,評估模型性價比。
  • 代碼執行擴展:E-Bench-Code 版本開放 exec_code 工具,可剝離編排機制與信息獲取兩類難度。

E-Bench的技術原理

  • 圖引導數據庫填充:從關係型 schema 出發構建表級依賴圖,按拓撲序填充根表與下游表,用強 LLM 作爲受約束合成器,僅通過插入工具寫入數據,下游表必須從當前庫查詢候選實體,最後用確定性腳本校驗修復時間順序、聚合計數等語義錯誤,確保環境完整自洽。
  • 生成器-求解器不對稱:出題 Agent 擁有 query_sqlexec_code 特權,能查看完整數據庫並執行復雜計算;被測 Agent 僅能調用業務級工具,形成信息鴻溝(全局狀態隱藏)與工具鴻溝(內部計算工具移除),迫使模型通過多步並行工具調用主動探索環境。
  • 意圖改寫與規則替換:將數據庫派生的具體值替換爲產生它的規則,例如”把收藏裏所有已下架的歌加進來”而非直接給出歌曲 ID,確保任務無法脫離環境交互獨立完成。
  • 交叉驗證任務生成:每個任務經查看數據→確定目標→修改狀態→總結意圖的產品化循環生成,由三個不同強 Agent 模型交叉驗證,至少兩個復現一致才採納,保證任務可解性與標註準確性。

如何使用E-Bench

  • 環境準備:從論文配套資源獲取 E-Bench 全合成虛擬環境,加載覆蓋王者榮耀、QQ 音樂、騰訊會議三大產品域的數據庫模板與 323 個評測任務。
  • 版本選擇:根據研究目標選擇基礎版 E-Bench或 E-Bench-Code。
  • 模型接入:將被測 LLM Agent 接入評測框架,配置其只能通過受限的領域工具(如搜索歌曲、創建會議、添加好友等)間接與環境交互,禁止直接查詢底層數據庫。
  • 任務配置:設定每任務獨立運行次數與全新數據庫副本起始條件,開啓 API 調用成本追蹤以確保結果可復現。
  • 執行評測:啓動自動化評測,Agent 接收自然語言指令後通過多步工具調用與虛擬環境交互並修改狀態,系統自動記錄完整操作軌跡與 Token 消耗。
  • 結果分析:評測結束後,系統基於確定性數據庫狀態 diff 輸出 Pass@1 與 Pass³ 準確率,生成成本-性能聯合分析報告,輔助評估模型性價比。

E-Bench的核心優勢

  • 真實規模干擾充分:每個庫填充至 7.6 萬+行、60 萬+數據單元,目標實體被大量近似記錄環繞,模型無法靠環境稀疏蒙對。
  • 環境任務解耦複用:一套自洽產品環境可支撐約上百個任務生成,邊際成本極低,環境層可控、任務層可擴展。
  • 評測穩定可復現:全合成環境不受線上服務演進影響,確定性 diff 評分消除語義裁判的主觀偏差。
  • 難度分層清晰:基礎版考驗多步編排與信息蒐集,Code 版額外測試計算密集型任務的代碼卸載能力。

E-Bench的項目地址

  • arXiv技術論文:https://arxiv.org/pdf/2607.23722

E-Bench的同類競品對比

維度 E-Bench SWE-bench
評測對象 多步驟工具使用 Agent(狀態變更、信息蒐集、工具編排) 代碼修復 Agent(GitHub Issue 對應代碼補丁)
環境構建 全合成虛擬產品環境,圖引導數據庫填充 真實開源代碼庫快照,基於 GitHub 歷史 Issue
任務類型 323 個狀態變更任務,涉及社交、音樂、辦公協作 真實軟件工程任務,涉及代碼理解與修改
評分機制 確定性數據庫狀態 diff,精確匹配通過 單元測試通過率,補丁應用後測試是否通過
可擴展性 環境任務解耦,一套環境支撐上百任務,邊際成本低 依賴真實代碼庫與 Issue,擴展受限於開源項目可用性
去污染難度 全合成環境,天然無污染,模型無法靠訓練記憶抄近道 需嚴格時間切分防止數據泄漏,去污染成本高
成本維度 同步測量 API 開銷,支持成本-性能聯合分析 主要關注功能正確性,成本分析非核心設計目標

E-Bench的應用場景

  • AI 智能體能力評測:爲 LLM Agent 提供標準化、可量化的多步工具使用能力評估,覆蓋信息檢索、狀態變更、跨實體編排等核心維度。
  • 模型選型與產品化決策:通過成本-性能帕累託圖,幫助企業在準確率與 API 開銷之間做出權衡,識別高性價比模型。
  • 智能體訓練數據合成:作爲可控、可擴展的訓練數據來源,用於持續提升 Agent 在多步工具調用與可靠性方面的能力。
  • 代碼增強 Agent 研究:E-Bench-Code 支持研究代碼執行對不同類型任務(計算密集 vs 推理決策)的收益邊界。
  • 跨領域基準擴展:方法論可遷移至更多產品後端與 CLI 場景,推動通用智能體評測標準建立。
© 版權聲明

相關文章

暫無評論

暫無評論...