PerceptionBench是什麼
PerceptionBench是月之暗面開源的視覺感知診斷基準。PerceptionBench 從 42 個現有評測集中前沿模型的失敗案例中,歸納出 10 項原子視覺感知能力,並構建 3,000 道隔離式驗證題,每題僅考察單一感知能力、無需推理或外部知識。測試顯示,當前 16 個主流多模態模型無一達到 60% 準確率,揭示了原子級視覺感知仍是行業未解難題。

PerceptionBench的主要功能
-
原子能力診斷:將視覺感知拆解爲 10 項原子能力,包含視覺關係、計數、屬性、深度、定位、組合、細粒度識別、上下文、OCR、幻覺,精確定位模型斷裂點。
-
隔離式評測:每道題目僅測試單一原子能力,避免推理與知識干擾,確保得分反映真實感知水平。
-
失敗案例歸因:基於 42 個現有基準的失敗案例分解出 1,800 道原子子問題,從真實錯誤中提煉評測維度。
-
綜合能力畫像:通過 Leaderboard 展示模型在 10 項能力上的詳細得分,揭示相似總分下截然不同的能力分佈。
- 開源可復現:提供完整代碼、Hugging Face 數據集與論文,支持社區復現與擴展。
PerceptionBench的技術原理
-
自底向上的錯誤分類法:通過診斷前沿 MLLM 在 42 個現有基準中的最早失敗點,構建錯誤分類樹,提取出感知分支的 10 項原子能力。
-
難度分層與能力平衡:從內部 17,000+ 驗證樣本池中,按能力維度平衡與難度分層抽樣 3,000 題,其中 60% 爲失敗案例分解的子問題,40% 爲基於補充圖像的新編題目。
-
短答案無歧義設計:所有題目要求簡短、明確的答案,降低評估不確定性,使自動化評測更可靠。
- 感知-推理解耦:題目設計確保挑戰來自視覺感知本身,而非推理鏈或領域知識,從而隔離測量感知邊界。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用PerceptionBench
-
克隆倉庫:從 GitHub 拉取
MoonshotAI/PerceptionBench開源代碼。 -
下載數據集:從 Hugging Face 獲取 3,000 道驗證題目與標註數據。
-
接入模型:將待評測的多模態模型接入評測框架,按標準格式輸出答案。
-
運行評測:執行評測腳本,自動計算模型在 10 項原子能力及總體上的準確率。
- 查看畫像:對照 Leaderboard 分析模型能力短板,指導後續訓練優化方向。
PerceptionBench的核心優勢
-
精準定位而非籠統打分:區別傳統基準將感知、推理、知識混爲一談,PerceptionBench 能精確診斷模型到底在哪個感知環節出錯。
-
從真實失敗中生長:從 42 個主流基準的真實失敗案例中提煉,確保評測貼近實際模型弱點。
-
暴露隱藏的能力鴻溝:相似總分的模型在原子能力上可能天差地別,PerceptionBench 的能力畫像可揭示這些被總分掩蓋的鴻溝。
- 推動感知優先發展:將行業焦點從刷分、拉回、感知基本功,促進更忠實、更一致的視覺理解能力。
PerceptionBench的項目地址
- 項目官網:https://www.kimi.com/blog/perception-bench
- GitHub倉庫:https://github.com/MoonshotAI/PerceptionBench
- HuggingFace模型庫:https://huggingface.co/datasets/moonshotai/PerceptionBench
- 技術論文:https://github.com/MoonshotAI/PerceptionBench/blob/master/paper/PerceptionBench.pdf
PerceptionBench的同類競品對比
| 維度 | PerceptionBench | MMMU / MMBench 等綜合基準 |
|---|---|---|
| 評測目標 | 原子級視覺感知能力診斷 | 綜合多模態理解與推理能力 |
| 題目規模 | 3,000 道驗證題 | MMMU 約 11.5K;MMBench 約 3.2K+ |
| 難度來源 | 純視覺感知本身 | 感知 + 推理 + 領域知識混合 |
| 知識要求 | 無需外部知識或複雜推理 | 需大學級專業知識與多步推理 |
| 題目設計 | 每題僅隔離單一原子能力 | 多能力交織,綜合考察 |
| 題目來源 | 42 個基準的失敗案例分解 + 新編 | 大學教材、考試、在線資源、視頻等 |
| 答案形式 | 簡短明確,降低評估歧義 | 多選題或開放式,部分需複雜推導 |
| 輸出價值 | 能力級診斷畫像,定位感知斷裂點 | 綜合排名,衡量整體水平 |
| 適用階段 | 模型研發期感知模塊調優 | 模型發佈後綜合能力評估 |
| 核心洞察 | 相似總分模型能力分佈可能天差地別 | 模型整體性能排序與差距量化 |
PerceptionBench的應用場景
-
模型研發診斷:多模態團隊在訓練後使用 PerceptionBench 定位模型感知短板,針對性優化數據或架構。
-
模型選型參考:企業用戶根據業務所需的特定感知能力,對照能力畫像選擇最合適的商用模型。
-
學術研究基準:作爲標準評測工具發表多模態感知相關論文,提供可復現的實驗環境。
-
行業能力標準:爲 MLLM 的視覺感知能力建立細粒度行業標準,替代粗放的”總分排名”文化。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...