WorkBuddy Bench – 騰訊開源的編碼智能體評測套件

AI工具2周前發佈新公告 AI管理員
0 0

WorkBuddy Bench是什麼

WorkBuddy Bench 是騰訊開源的編碼智能體評測套件,覆蓋代碼、網頁、辦公、安全四大真實場景。任務從真實 commit、PR 及業務場景逆向構建,改寫爲口語化請求以抗數據污染。在260 個任務在隔離沙箱中通過隱藏測試、規則檢查與 LLM 評判多元評分,並在雙框架下交叉驗證,實現開源可復現、可審計的端到端評測。

WorkBuddy Bench – 騰訊開源的編碼智能體評測套件

WorkBuddy Bench的主要功能

  • Code(代碼):80 個倉庫級軟件工程任務,涵蓋 bug 修復、功能開發、接口調整、算法實現等 18 個類別,由開發者、算法工程師、產品經理、QA、運維五種角色發起請求。
  • Web(網頁):70 個前端任務,覆蓋頁面實現、交互設計、數據可視化、視覺設計、代碼測試、文檔轉換等 7 個類別,要求交付可運行的前端製品而非對話文本。
  • Office(辦公):50 個多文件業務流程任務,智能體需處理電子表格、文檔、PDF、JSON 等混合格式文件,完成數據覈對、報告生成、狀態更新等交接型工作。
  • Security(安全):60 個紅藍隊安全任務,包括漏洞發現與利用、惡意軟件分析、安全運營、AI 智能體安全評估,採用確定性評分腳本,無 LLM 評判器參與。

WorkBuddy Bench的技術原理

  • 逆向工程構建:每個任務從真實代碼提交、PR、CVE 或業務場景逆向工程而來,改寫爲簡短口語化的角色扮演請求,使提示詞無法通過搜索引擎還原。
  • 刻意信息不充分:請求僅陳述意圖與約束,省略目標文件、精確接口、邊界處理等細節,智能體必須自行從工作區恢復上下文,測試需求消歧與落地能力。
  • 回合後評估隔離:智能體解題期間能看到任務指令與工作區,評分資產(隱藏測試、評分細則等)在完成後才引入沙箱,避免評分信息泄露。
  • 雙框架交叉驗證:所有任務在 CodeBuddy Code 與 Claude Code 兩種智能體框架下分別運行,消除單一框架的系統性偏差。
  • 抗污染機制:依賴任務構建方式封閉可搜索提示路徑,配合數據集版本管理定期刷新,替代傳統保密式防污染方案。

WorkBuddy Bench – 騰訊開源的編碼智能體評測套件

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用WorkBuddy Bench

  • 獲取任務集:訪問 GitHub 下載標準化任務目錄,包含 instruction.md、task.toml、environment/ 環境鏡像與 tests/ 評分資產。
  • 運行評測:將智能體接入 Harbor 風格任務目錄,在隔離 Docker 沙箱中執行,智能體讀取自然語言請求後探索工作區並生成製品。
  • 查看結果:任務完成後自動運行評分器,代碼子集通過隱藏單元測試評分,網頁子集通過規則+LLM/VLM+智能體評判器評分,辦公子集通過規則檢查與證據驅動的 LLM 評判器評分,安全子集通過確定性 scoring.py 評分。
  • 獨立審計:任何第三方均可離線重新運行單個任務並直接檢查其內容,實現端到端可復現與可審計。

WorkBuddy Bench的核心優勢

  • 真實工作分佈:任務類別、模式、難度均匹配內部真實使用分類法,非基於公開題庫或教程練習構造。
  • 完全開源可審計:任務目錄、環境鏡像、評估代碼、評分測試、參考答案全部公開,區別於 CursorBench 等封閉廠商基準。
  • 多維度評分體系:代碼用隱藏測試、網頁用規則+語義+交互三重評判、辦公用規則+證據驅動 LLM 評判、安全用確定性腳本,各子集評分工具獨立設計。
  • 角色與場景多樣性:代碼子集引入五種請求者角色,安全子集覆蓋紅藍隊全頻譜,避免單一任務類型導致的評估偏差。
  • 效率與能力解耦:排行榜同時報告 token 消耗與輪次效率,GPT-5.5 以最小輸出預算取得頂級分數,證明高分不等於高消耗。

WorkBuddy Bench的項目地址

  • 項目官網:https://workbuddybench.com/
  • GitHub倉庫:https://github.com/Tencent/workbuddy-bench
  • HuggingFace模型庫:https://huggingface.co/datasets/tencent/workbuddy-bench
  • 技術論文:https://workbuddybench.com/report/main.pdf

WorkBuddy Bench的同類競品對比

維度 WorkBuddy Bench SWE-bench
任務來源 真實 commit/PR/業務場景逆向工程 公開 GitHub issue
抗污染方式 構建層面封閉搜索路徑+版本管理 依賴發佈時的新穎性
覆蓋領域 Code / Web / Office / Security 四領域 僅代碼缺陷修復
開源程度 任務/鏡像/評分/答案全部公開 公開任務集與測試
請求風格 口語化、角色扮演、信息不充分 詳細技術 issue 描述
評測框架 雙框架(CodeBuddy + Claude Code) 單一框架

WorkBuddy Bench的應用場景

  • 智能體研發基準:爲編碼智能體、前端 AI 工具、辦公自動化 Agent、安全 AI 提供標準化能力標尺。
  • 模型選型參考:跨模型排行榜覆蓋 Claude Opus 4.8、GPT-5.5、GLM-5.2、DeepSeek-V4 等主流模型,輔助企業選型。
  • 學術研究與對比:完全開源的任務集與評分協議,支持第三方復現、審計與改進,推動領域基準迭代。
  • 產品迭代優化:通過細分的子集得分與 token 效率數據,定位智能體在代碼導航、前端狀態管理、跨文件一致性等具體環節的短板。
  • 安全能力評估: 獨立的安全子集爲 AI 紅隊與藍隊能力提供可量化的攻防測試環境。
© 版權聲明

相關文章

暫無評論

暫無評論...