PAST-Bench – 普林斯頓推出的個人 Agent 的性能歸因基準

AI工具1個月前發佈新公告 AI管理員
0 0

PAST-Bench是什麼

PAST-Bench 是普林斯頓大學王夢迪團隊推出出的基準測試,用於檢驗個人 AI Agent 的遞歸自我改進能力。PAST-Bench通過對比有記憶與無記憶條件下的任務表現,判斷 Agent 保存的跨會話經驗是否真正改進了後續行爲。PAST-Bench 涵蓋記憶、流程複用、信息蒐集、更新四類能力,共 26 個場景 204 個任務回合。

PAST-Bench – 普林斯頓推出的個人 Agent 的性能歸因基準

PAST-Bench的主要功能

  • 評估遞歸自我改進:檢驗個人 AI Agent 保存的跨會話經驗(記憶、技能、任務歷史)是否真正改進了後續行爲。
  • 隔離經驗積累效果:區分”得分提升來自經驗積累”還是”基礎模型變強/Prompt 變化/任務難度”等其他因素。
  • 四維能力診斷:覆蓋記憶、流程複用、信息蒐集、狀態更新四大維度,定位 Agent 具體哪類能力有缺陷。
  • 機制歸因分析:不僅看最終得分,還追蹤”存儲→檢索→應用”的完整路徑,判斷改進是否有真實路徑支撐。

PAST-Bench的技術原理

  • 任務族序列設計:Agent 按順序執行同一任務族的多輪會話。早期會話創造保存經驗的機會,後期會話檢驗這些經驗是否被正確使用。
  • 匹配對照實驗:爲每輪後期會話設計對照版本,關閉持久化能力,其他條件完全一致。通過”有記憶得分 – 無記憶得分”得到自我進化差值 Δ。
  • 機制證據追蹤:運行時記錄記憶寫入、技能調用、會話檢索、狀態更新等遙測數據,計算 Mechanism-Evidence Score,驗證改進是否遵循預期路徑。
  • 持久化產物審計:檢查 Agent 實際保存的內容(記憶條目、技能文件、會話索引),分析其結構、時效性和可複用性。

如何使用PAST-Bench

  • 環境準備:從 GitHub 克隆 PAST-Bench 倉庫並安裝核心依賴及 Agent 適配器。
  • 模型配置:在環境變量中配置所使用模型的 API Key。
  • 沙箱構建:執行 past-bench build-image --kind sandbox 構建評估所需的 Docker 沙箱鏡像。
  • 快速驗證:用 past-bench evolve 運行單個任務族並加上 --compare-no-persistence 參數做 Smoke Test。
  • 完整評估:遍歷全部 26 個任務族運行評估,每個任務族自動執行”有持久化”和”無持久化”兩組對照實驗。
  • 結果分析:在 --trace-dir 目錄下查看 sequence_comparison.json,獲取 Δ 值和機制證據分數。
  • 自定義接入:如需評估自有 Agent,在 agents/ 目錄下實現適配器並確保支持 --compare-no-persistence 開關即可。

PAST-Bench的核心優勢

  • 真正的歸因能力:PAST-Bench 能精確區分改進來自經驗積累是模型本身變強/Prompt 變化/任務變簡”。
  • 匹配對照實驗設計:每個任務族都配有關閉持久化的對照版本,其他條件完全一致,實現有記憶與無記憶的直接因果對比。
  • 機制級診斷:提出 Mechanism-Evidence Score,判斷 Agent 是否答對,還追蹤”存儲→檢索→應用”的完整路徑,識別”碰巧答對”與”真正複用經驗”的區別。
  • 四維能力拆解:將模糊的自我改進拆分爲記憶、流程複用、信息蒐集、狀態更新四類具體能力,精準定位短板。
  • 診斷驅動改進:基於基準暴露的運行時故障,直接催生 Hermes+ 框架,證明其不僅是評估工具,更是 Agent 架構優化的診斷引擎。

PAST-Bench的項目地址

  • GitHub倉庫:https://github.com/Gen-Verse/PAST-Bench
  • arXiv技術論文:https://arxiv.org/pdf/2608.04003

PAST-Bench的同類競品對比

維度 PAST-Bench SWE-Bench
核心目標 檢驗 Agent 保存的跨會話經驗是否真正改進了後續行爲 檢驗 Agent 能否一次性正確修復真實 GitHub issue
評估單元 一個任務族的多輪會話序列(早期積累 → 後期複用) 單個獨立的代碼修復任務
持久化設計 核心設計:支持持久化狀態(記憶、技能、會話歷史)的開啓與關閉 無持久化:每個任務都是全新環境,Agent 從零開始
對照機制 匹配對照實驗——同一任務族分別運行”有記憶”和”無記憶”版本,精確歸因 Δ 值 無對照設計——只判斷 patch 是否正確,不區分改進來源
歸因粒度 機制級:通過 Mechanism-Evidence Score 追蹤”存儲→檢索→應用”的完整路徑 結果級:只判斷最終 patch 是否通過測試用例
能力覆蓋 記憶、流程複用、信息蒐集、狀態更新(4 類跨會話能力) 代碼理解、調試、測試驅動開發(單會話能力)
典型輸出 sequence_comparison.json(含 Δ 值、機制證據分數) 通過率(Resolved %)

PAST-Bench的應用場景

  • 學術研究:爲 Agent 遞歸自我改進提供標準化、可復現的量化評估環境,支持不同架構的客觀對比。
  • 框架開發:通過四維能力拆解精準定位 Agent 框架短板,指導架構優化(如 Hermes+ 的誕生)。
  • 模型選型:在固定框架下對比不同基座模型的跨會話經驗複用表現,識別各模型的能力偏向。
  • 持久化驗證:測試不同記憶結構和檢索策略的實際效果,避免”存了但找不到”或”存了但沒用”的無效持久化。
  • 產品迭代:區分新版本得分提升是來自”跨會話經驗積累”還是”基礎模型變強”,確保持久化功能真實產生價值。
© 版權聲明

相關文章

暫無評論

暫無評論...