PerceptionBench – 月之暗面開源的視覺感知診斷基準

AI工具2天前發佈新公告 AI管理員
0 0

PerceptionBench是什麼

PerceptionBench是月之暗面開源的視覺感知診斷基準。PerceptionBench 從 42 個現有評測集中前沿模型的失敗案例中,歸納出 10 項原子視覺感知能力,並構建 3,000 道隔離式驗證題,每題僅考察單一感知能力、無需推理或外部知識。測試顯示,當前 16 個主流多模態模型無一達到 60% 準確率,揭示了原子級視覺感知仍是行業未解難題。

PerceptionBench – 月之暗面開源的視覺感知診斷基準

PerceptionBench的主要功能

  • 原子能力診斷:將視覺感知拆解爲 10 項原子能力,包含視覺關係、計數、屬性、深度、定位、組合、細粒度識別、上下文、OCR、幻覺,精確定位模型斷裂點。
  • 隔離式評測:每道題目僅測試單一原子能力,避免推理與知識干擾,確保得分反映真實感知水平。
  • 失敗案例歸因:基於 42 個現有基準的失敗案例分解出 1,800 道原子子問題,從真實錯誤中提煉評測維度。
  • 綜合能力畫像:通過 Leaderboard 展示模型在 10 項能力上的詳細得分,揭示相似總分下截然不同的能力分佈。
  • 開源可復現:提供完整代碼、Hugging Face 數據集與論文,支持社區復現與擴展。

PerceptionBench的技術原理

  • 自底向上的錯誤分類法:通過診斷前沿 MLLM 在 42 個現有基準中的最早失敗點,構建錯誤分類樹,提取出感知分支的 10 項原子能力。
  • 難度分層與能力平衡:從內部 17,000+ 驗證樣本池中,按能力維度平衡與難度分層抽樣 3,000 題,其中 60% 爲失敗案例分解的子問題,40% 爲基於補充圖像的新編題目。
  • 短答案無歧義設計:所有題目要求簡短、明確的答案,降低評估不確定性,使自動化評測更可靠。
  • 感知-推理解耦:題目設計確保挑戰來自視覺感知本身,而非推理鏈或領域知識,從而隔離測量感知邊界。

PerceptionBench – 月之暗面開源的視覺感知診斷基準

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用PerceptionBench

  • 克隆倉庫:從 GitHub 拉取 MoonshotAI/PerceptionBench 開源代碼。
  • 下載數據集:從 Hugging Face 獲取 3,000 道驗證題目與標註數據。
  • 接入模型:將待評測的多模態模型接入評測框架,按標準格式輸出答案。
  • 運行評測:執行評測腳本,自動計算模型在 10 項原子能力及總體上的準確率。
  • 查看畫像:對照 Leaderboard 分析模型能力短板,指導後續訓練優化方向。

PerceptionBench的核心優勢

  • 精準定位而非籠統打分:區別傳統基準將感知、推理、知識混爲一談,PerceptionBench 能精確診斷模型到底在哪個感知環節出錯。
  • 從真實失敗中生長:從 42 個主流基準的真實失敗案例中提煉,確保評測貼近實際模型弱點。
  • 暴露隱藏的能力鴻溝:相似總分的模型在原子能力上可能天差地別,PerceptionBench 的能力畫像可揭示這些被總分掩蓋的鴻溝。
  • 推動感知優先發展:將行業焦點從刷分、拉回、感知基本功,促進更忠實、更一致的視覺理解能力。

PerceptionBench的項目地址

  • 項目官網:https://www.kimi.com/blog/perception-bench
  • GitHub倉庫:https://github.com/MoonshotAI/PerceptionBench
  • HuggingFace模型庫:https://huggingface.co/datasets/moonshotai/PerceptionBench
  • 技術論文:https://github.com/MoonshotAI/PerceptionBench/blob/master/paper/PerceptionBench.pdf

PerceptionBench的同類競品對比

維度 PerceptionBench MMMU / MMBench 等綜合基準
評測目標 原子級視覺感知能力診斷 綜合多模態理解與推理能力
題目規模 3,000 道驗證題 MMMU 約 11.5K;MMBench 約 3.2K+
難度來源 純視覺感知本身 感知 + 推理 + 領域知識混合
知識要求 無需外部知識或複雜推理 需大學級專業知識與多步推理
題目設計 每題僅隔離單一原子能力 多能力交織,綜合考察
題目來源 42 個基準的失敗案例分解 + 新編 大學教材、考試、在線資源、視頻等
答案形式 簡短明確,降低評估歧義 多選題或開放式,部分需複雜推導
輸出價值 能力級診斷畫像,定位感知斷裂點 綜合排名,衡量整體水平
適用階段 模型研發期感知模塊調優 模型發佈後綜合能力評估
核心洞察 相似總分模型能力分佈可能天差地別 模型整體性能排序與差距量化

PerceptionBench的應用場景

  • 模型研發診斷:多模態團隊在訓練後使用 PerceptionBench 定位模型感知短板,針對性優化數據或架構。
  • 模型選型參考:企業用戶根據業務所需的特定感知能力,對照能力畫像選擇最合適的商用模型。
  • 學術研究基準:作爲標準評測工具發表多模態感知相關論文,提供可復現的實驗環境。
  • 行業能力標準:爲 MLLM 的視覺感知能力建立細粒度行業標準,替代粗放的”總分排名”文化。
© 版權聲明

相關文章

暫無評論

暫無評論...