MemHarness是什麼
MemHarness 是上海 AI Lab 聯合浙大、復旦、上海交大等高校推出的 LLM Agent 記憶重構框架。現有記憶增強 Agent 常將檢索到的歷史經驗直接注入上下文,若舊經驗與當前狀態不匹配反而導致負遷移。MemHarness 受人類記憶重構機制啓發,在檢索與動作之間插入顯式的批判與重構環節,結合當前上下文對歷史經驗進行保留、改寫或丟棄,通過 GRPO 端到端訓練,無需額外人工標註。

MemHarness的主要功能
-
記憶檢索:Agent 根據當前觀測生成查詢,從 Milvus 向量記憶庫中召回 top-k 相關歷史經驗及其來源狀態。
-
批判與重構:統一策略模型對比記憶來源狀態與當前狀態,批判其適用性,將經驗改寫爲狀態對齊的指導信息,或判定爲不適用而捨棄。
-
動作生成:基於重構後的指導信息或自主推理,生成可執行的環境動作。
-
經驗回寫與剪枝:每輪交互後將軌跡摘要爲經驗寫入記憶庫,進行語義去重,定期按經驗效用剪枝低價值記憶。
-
端到端訓練:通過 GRPO 聯合優化檢索、重構與動作生成,無需重構階段的獨立標註數據。
MemHarness的技術原理
- 五階段決策流程:MemHarness 將記憶引導的決策分解爲環境觀測、經驗檢索、記憶批判、上下文記憶重構與動作生成五個連續階段,模擬人類檢索—評估—重構的認知過程,取代傳統 Agent 直接回放記憶的靜態範式。
- 上下文記憶重構機制:策略模型將任務描述、當前歷史、檢索到的經驗及其來源狀態拼接爲重構上下文,通過對比歷史來源狀態與當前狀態識別差異,保留可遷移知識、改寫不匹配內容,或輸出
<EMPTY>標記拒絕該記憶並回退到自主推理。 - 統一策略模型架構: 檢索查詢生成、記憶批判重構與可執行動作生成三個階段共享同一個策略模型參數,無需爲重構模塊單獨訓練價值網絡或監督數據,使記憶利用與決策推理在同一模型內緊密耦合。
- GRPO 端到端訓練:由於重構指導信息沒有真值標註,MemHarness 採用 GRPO 對檢索—重構—行動全鏈路進行端到端優化;獎勵由稀疏任務結果與格式獎勵組成,通過組歸一化優勢將軌跡級信用分配給所有 token,同時訓練思考、重構與動作生成能力。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用MemHarness
-
克隆倉庫並創建環境:執行
git clone https://github.com/KnowledgeXLab/MemHarness.git並創建python==3.12的 Conda 環境,依次安裝 vLLM、Flash Attention 2 及 MemHarness 本體。 -
部署嵌入服務:通過
vllm serve BAAI/bge-m3 --port 8001啓動 BGE-M3 嵌入模型,爲 Milvus 記憶庫提供向量編碼服務。 -
安裝目標環境:根據任務需求分別安裝 ALFWorld 或 WebShop 交互環境,並下載對應的遊戲文件與預訓練檢測器。
-
冷啓動 SFT(可選):運行
scripts/build_*_coldstart_data.py構建冷啓動數據,執行scripts/cold_start_sft.sh使模型對齊交互格式與記憶摘要格式。 -
GRPO 端到端訓練:運行
run_scripts/train_alfworld.sh或run_scripts/train_webshop.sh,框架將自動啓動記憶向量數據庫、執行 Agent 檢索、經驗回寫與剪枝,完成 GRPO 訓練。
MemHarness的核心優勢
-
重構優於回放:顯式插入批判與重構環節,將靜態記憶片段轉化爲上下文敏感的狀態對齊指導,避免負遷移。
-
小模型超越大模型:7B 參數規模在 ALFWorld 和 WebShop 上分別超越 Gemini-2.5-Pro 23.1% 和 39.7%。
-
OOD 魯棒性強:在分佈外場景中平均成功率達 85.9%,顯著高於原始記憶回放的 76.3%。
-
隱式推理增強:即使測試時關閉記憶,重構訓練目標仍使基礎策略成功率從 76.4% 提升至 83.0%,從根本上增強 Agent 內在推理能力。
-
無需額外標註:重構能力通過 GRPO 端到端訓練自然湧現,不依賴人工編寫的重構監督數據。
MemHarness的項目地址
- GitHub倉庫:https://github.com/KnowledgeXLab/MemHarness
- HuggingFace模型庫:https://huggingface.co/KnowledgeXLab/MemHarness
- arXiv技術論文:https://arxiv.org/pdf/2607.28272
MemHarness的同類競品對比
| 維度 | MemHarness | EvolveR |
|---|---|---|
| 記憶範式 | 顯式記憶庫 + 狀態條件重構 | 顯式記憶庫 + 經驗演化 |
| 核心機制 | 檢索後批判重構,保留/改寫/丟棄 | 檢索後直接注入,依賴經驗演化迭代 |
| 訓練方式 | GRPO 端到端,無需重構標註 | RL 訓練,記憶經驗需逐步演化積累 |
| OOD 表現 | 85.9%(ALFWorld OOD) | 未重點報告 OOD 魯棒性 |
| 可解釋性 | 重構過程可檢查,支持 EMPTY 拒絕 | 記憶注入過程相對黑盒 |
| 模型規模 | 7B 即超越 Gemini-2.5-Pro | 通常需更大規模或更多訓練步數 |
MemHarness的應用場景
-
具身智能家務:在 ALFWorld 等家庭環境中,Agent 可重構過往取物、清潔經驗,適配不同房間佈局完成複雜家務任務。
-
自主在線購物:在 WebShop 等電商平台中,根據歷史購物經驗重構爲當前商品搜索與篩選策略,提升目標導向購物成功率。
-
智能客服對話:客服 Agent 檢索歷史相似工單後重構解決方案,避免直接套用舊答覆導致答非所問。
-
代碼輔助開發:編程 Agent 重構過往 bug 修復經驗,適配當前代碼上下文,提供精準的修復建議而非照搬舊方案。
-
科研實驗規劃:實驗 Agent 根據歷史實驗參數與結果重構爲當前實驗條件的最優配置建議,減少試錯成本。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...