LLM-as-a-Verifier – 斯坦福聯合英偉達等開源的通用驗證框架

AI工具12小時前發佈新公告 AI管理員
0 0

LLM-as-a-Verifier是什麼

LLM-as-a-Verifier 是斯坦福、UC 伯克利與 NVIDIA 研究院聯合開源的通用驗證框架。框架無需額外訓練,通過用 LLM 評分 Token 的完整 logits 分佈生成連續細粒度分數,替代傳統離散評分。框架支持在評分粒度、重複評估、準則分解三個維度擴展驗證能力,可用於測試時候選篩選、Agent 進度跟蹤和強化學習密集獎勵。在 Terminal-Bench、SWE-Bench 等基準上達到 SOTA。

LLM-as-a-Verifier – 斯坦福聯合英偉達等開源的通用驗證框架

LLM-as-a-Verifier的主要功能

  • 細粒度驗證評分:用評分 Token 的完整 logits 分佈計算連續期望值,替代粗糙的離散打分,顯著降低平局率。
  • 測試時 Best-of-N 選擇:通過 Probabilistic Pivot Tournament 算法以線性成本從多條候選軌跡中篩選最優解,實現低成本自我驗證。
  • 實時進度跟蹤:對 Agent 執行的每一步輸出細粒度分數,既可離線覆盤完整軌跡,也可在線監測並提前終止無望任務。
  • 強化學習密集獎勵:作爲可插拔的密集獎勵信號,提升離線/在線 RL 算法的樣本效率。
  • 多模態輸入支持:除文本外可直接處理圖像和視頻,統一驗證 VLM Agent 與機器人視覺 rollout。
  • Claude Code 插件集成:通過 TurboAgent 代理自動並行生成多個回覆並實時篩選最優,無需改動原有工作流。

LLM-as-a-Verifier的技術原理

  • 概率化細粒度評分:將傳統離散評分改爲利用評分 Token 的完整 logits 分佈計算期望值。模型在 1–20 區間輸出分數,提取各 Token 的 logprob 後加權求和並歸一化到 [0,1],從而保留模型的不確定性信息,避免單一離散值導致的高平局率與信息損失。
  • 三維驗證擴展:驗證可在粒度、重複、分解三個維度獨立擴展:增加評分 Token 數量提升正負樣本分離度;多次獨立評估取平均降低方差;將評估拆分爲 Specification、Error、Output 等子準則分別打分後聚合,減少提示偏見。三者組合可在控制預算下持續提升驗證準確率。
  • 概率錨點錦標賽(PPT):爲將 Best-of-N 的排序成本從 O(N²) 降至 O(Nk),算法先通過環狀對比獲得初始勝率,選出 top-k 錨點;隨後非錨點僅與錨點對比,錨點間相互較量;最後基於 Bradley-Terry 模型聚合勝負關係排序,將預算集中在不確定的頭部候選。
  • 偏好建模與多模態輸出:連續獎勵經 Bradley-Terry 模型轉換爲成對偏好概率,支撐可靠的候選比較。框架統一處理文本、圖像、視頻輸入,並輸出三類信號:測試時排序信號、時間對齊的進度跟蹤信號,以及可直接用於 RL 訓練的密集獎勵信號,實現零樣本通用驗證。

LLM-as-a-Verifier – 斯坦福聯合英偉達等開源的通用驗證框架

微信關注回覆“開源”,加入AI開源項目交流羣

LLM-as-a-Verifier的核心優勢

  • 零樣本即用:無需額外訓練、標註數據或專用獎勵模型,開箱即可爲任意 Agent 任務提供細粒度驗證。
  • 細粒度連續評分:用評分 Token 的完整 logits 分佈計算期望值,生成 [0,1] 連續分數,顯著降低傳統離散評分的高平局率。
  • 三維獨立擴展:支持在評分粒度、重複評估、準則分解三個維度上系統性擴展驗證能力,持續提升精度。
  • 低成本高效排序:Probabilistic Pivot Tournament 算法將 Best-of-N 的對比成本從 O(N²) 降至 O(Nk),大幅節省驗證開銷。
  • 跨模態通用:原生支持文本、圖像和視頻輸入,統一驗證代碼 Agent、VLM 和機器人 rollout。
  • 三位一體輸出:同時提供測試時候選篩選、實時進度跟蹤和強化學習密集獎勵三種信號,覆蓋 Agent 全生命週期。

LLM-as-a-Verifier的項目地址

  • 項目官網:https://llm-as-a-verifier.com/
  • GitHub倉庫:https://github.com/llm-as-a-verifier/llm-as-a-verifier
  • arXiv技術論文:https://arxiv.org/pdf/2607.05391

LLM-as-a-Verifier的同類競品對比

對比維度 LLM-as-a-Verifier 訓練過的獎勵模型 (Learned RM)
訓練需求 零樣本,無需訓練或標註數據 需大量人工偏好數據訓練,成本高
泛化能力 跨領域通用,開箱即用 受訓練數據分佈限制,跨域易失效
反饋粒度 細粒度連續值,支持多維度分解 通常爲單一標量分數,粒度較粗
不確定性建模 利用完整 logits 分佈,顯式量化置信度 通常輸出點估計,無不確定性信息
計算成本 驗證階段 O(Nk) 次 API 調用 推理時單次前向傳播,但訓練成本極高
可擴展性 支持粒度/重複/分解三維獨立擴展 模型架構固定,擴展需重新訓練
多模態支持 原生支持文本/圖像/視頻 需針對各模態單獨訓練
最佳適用 快速驗證、進度跟蹤、RL 密集獎勵 大規模在線服務、已穩定的單一領域

LLM-as-a-Verifier的應用場景

  • 代碼 Agent 驗證:在 Terminal-Bench 和 SWE-Bench 等編程基準中,對多條代碼生成軌跡進行 Best-of-N 篩選,以低成本選出可編譯、可運行的最優方案。
  • 機器人任務評估:在 RoboRewardBench 等機器人基準中,對視覺-動作 rollout 進行細粒度打分,判斷任務完成度與動作合理性,超越專用機器人獎勵模型。
  • 醫療 Agent 審覈:在 MedAgentBench 上驗證醫療診斷或用藥建議的準確性,確保 Agent 輸出符合醫學規範與安全標準。
  • 強化學習密集獎勵:作爲可插拔的密集獎勵信號替代稀疏 0/1 獎勵,接入 SAC 或 GRPO 等算法,顯著提升機器人與數學推理任務的樣本效率。
  • Agent 進度跟蹤與早期終止:對 Agent 執行的每一步實時輸出驗證分數,繪製任務進展曲線,從而及時終止無望的 rollout 以節省計算成本。
© 版權聲明

相關文章

暫無評論

暫無評論...