PAST-Bench是什麼
PAST-Bench 是普林斯頓大學王夢迪團隊推出出的基準測試,用於檢驗個人 AI Agent 的遞歸自我改進能力。PAST-Bench通過對比有記憶與無記憶條件下的任務表現,判斷 Agent 保存的跨會話經驗是否真正改進了後續行爲。PAST-Bench 涵蓋記憶、流程複用、信息蒐集、更新四類能力,共 26 個場景 204 個任務回合。

PAST-Bench的主要功能
-
評估遞歸自我改進:檢驗個人 AI Agent 保存的跨會話經驗(記憶、技能、任務歷史)是否真正改進了後續行爲。
-
隔離經驗積累效果:區分”得分提升來自經驗積累”還是”基礎模型變強/Prompt 變化/任務難度”等其他因素。
-
四維能力診斷:覆蓋記憶、流程複用、信息蒐集、狀態更新四大維度,定位 Agent 具體哪類能力有缺陷。
-
機制歸因分析:不僅看最終得分,還追蹤”存儲→檢索→應用”的完整路徑,判斷改進是否有真實路徑支撐。
PAST-Bench的技術原理
-
任務族序列設計:Agent 按順序執行同一任務族的多輪會話。早期會話創造保存經驗的機會,後期會話檢驗這些經驗是否被正確使用。
-
匹配對照實驗:爲每輪後期會話設計對照版本,關閉持久化能力,其他條件完全一致。通過”有記憶得分 – 無記憶得分”得到自我進化差值 Δ。
-
機制證據追蹤:運行時記錄記憶寫入、技能調用、會話檢索、狀態更新等遙測數據,計算 Mechanism-Evidence Score,驗證改進是否遵循預期路徑。
-
持久化產物審計:檢查 Agent 實際保存的內容(記憶條目、技能文件、會話索引),分析其結構、時效性和可複用性。
如何使用PAST-Bench
- 環境準備:從 GitHub 克隆 PAST-Bench 倉庫並安裝核心依賴及 Agent 適配器。
- 模型配置:在環境變量中配置所使用模型的 API Key。
- 沙箱構建:執行
past-bench build-image --kind sandbox構建評估所需的 Docker 沙箱鏡像。 - 快速驗證:用
past-bench evolve運行單個任務族並加上--compare-no-persistence參數做 Smoke Test。 - 完整評估:遍歷全部 26 個任務族運行評估,每個任務族自動執行”有持久化”和”無持久化”兩組對照實驗。
- 結果分析:在
--trace-dir目錄下查看sequence_comparison.json,獲取 Δ 值和機制證據分數。 - 自定義接入:如需評估自有 Agent,在
agents/目錄下實現適配器並確保支持--compare-no-persistence開關即可。
PAST-Bench的核心優勢
-
真正的歸因能力:PAST-Bench 能精確區分改進來自經驗積累是模型本身變強/Prompt 變化/任務變簡”。
-
匹配對照實驗設計:每個任務族都配有關閉持久化的對照版本,其他條件完全一致,實現有記憶與無記憶的直接因果對比。
-
機制級診斷:提出 Mechanism-Evidence Score,判斷 Agent 是否答對,還追蹤”存儲→檢索→應用”的完整路徑,識別”碰巧答對”與”真正複用經驗”的區別。
-
四維能力拆解:將模糊的自我改進拆分爲記憶、流程複用、信息蒐集、狀態更新四類具體能力,精準定位短板。
-
診斷驅動改進:基於基準暴露的運行時故障,直接催生 Hermes+ 框架,證明其不僅是評估工具,更是 Agent 架構優化的診斷引擎。
PAST-Bench的項目地址
- GitHub倉庫:https://github.com/Gen-Verse/PAST-Bench
- arXiv技術論文:https://arxiv.org/pdf/2608.04003
PAST-Bench的同類競品對比
| 維度 | PAST-Bench | SWE-Bench |
|---|---|---|
| 核心目標 | 檢驗 Agent 保存的跨會話經驗是否真正改進了後續行爲 | 檢驗 Agent 能否一次性正確修復真實 GitHub issue |
| 評估單元 | 一個任務族的多輪會話序列(早期積累 → 後期複用) | 單個獨立的代碼修復任務 |
| 持久化設計 | 核心設計:支持持久化狀態(記憶、技能、會話歷史)的開啓與關閉 | 無持久化:每個任務都是全新環境,Agent 從零開始 |
| 對照機制 | 匹配對照實驗——同一任務族分別運行”有記憶”和”無記憶”版本,精確歸因 Δ 值 | 無對照設計——只判斷 patch 是否正確,不區分改進來源 |
| 歸因粒度 | 機制級:通過 Mechanism-Evidence Score 追蹤”存儲→檢索→應用”的完整路徑 | 結果級:只判斷最終 patch 是否通過測試用例 |
| 能力覆蓋 | 記憶、流程複用、信息蒐集、狀態更新(4 類跨會話能力) | 代碼理解、調試、測試驅動開發(單會話能力) |
| 典型輸出 | sequence_comparison.json(含 Δ 值、機制證據分數) |
通過率(Resolved %) |
PAST-Bench的應用場景
-
學術研究:爲 Agent 遞歸自我改進提供標準化、可復現的量化評估環境,支持不同架構的客觀對比。
-
框架開發:通過四維能力拆解精準定位 Agent 框架短板,指導架構優化(如 Hermes+ 的誕生)。
-
模型選型:在固定框架下對比不同基座模型的跨會話經驗複用表現,識別各模型的能力偏向。
-
持久化驗證:測試不同記憶結構和檢索策略的實際效果,避免”存了但找不到”或”存了但沒用”的無效持久化。
-
產品迭代:區分新版本得分提升是來自”跨會話經驗積累”還是”基礎模型變強”,確保持久化功能真實產生價值。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...