MineExplorer是什麼
MineExplorer美團LongCat團隊推出的,首個基於Minecraft的開放世界分鐘級長程任務評測基準。MineExplorer包含813個1-4跳人工驗證實例,任務含隱藏前置條件,指令不枚舉依賴圖,需模型自主推斷子任務。MineExplorer主動剝離遊戲專有知識,僅測通用動態探索能力。配套五智能體協作數據合成與規則化里程碑自動評測框架,代碼與數據集現已開源。

MineExplorer的主要功能
-
分鐘級開放世界評測:基於Minecraft實時3D沙盒,每個任務運行1800環境步,模型需根據動態畫面持續調整策略。
-
隱藏前置多跳任務:提供813個1-4跳人工驗證實例,指令僅給出最終目標,隱藏前置子任務,需模型自主推斷依賴圖。
-
知識解耦評測:主動剝離Minecraft專有機制,僅保留依賴通用世界常識的任務。
-
規則化自動評測:將子任務轉化爲可自動執行的里程碑檢查器,實現無需人工標註的自動評分。
-
多智能體數據合成:五Agent協作自動生成任務,包含任務選擇、場景設計、里程碑設計、專家審查與驗證全流程。
MineExplorer的技術原理
-
動態環境交互架構:評測環境爲實時運行的物理沙盒,非靜態截圖問答;模型每執行一個動作,世界狀態即時更新,且基於最新觀測進行持續決策。
-
隱式DAG任務建模:每個複合任務定義爲四元組τ=(q,s₀,Gτ,Mτ),Gτ爲任務依賴圖,關鍵設計在於指令q不枚舉DAG中所有節點,智能體必須從環境中推斷隱藏前置任務。
-
多智能體協作造題流程:由orchestrator控制五個專業Agent(任務選擇器、場景設計師、里程碑設計師、Minecraft專家、驗證器)在羣聊中協作,分初始化與辯論兩階段生成初稿並修訂,相比單智能體有效率提升約30%。
-
知識過濾機制:用LLM裁判對每個原子任務進行領域知識判斷,區分通用世界常識與Minecraft專有機制,過濾依賴後者的高難度遊戲專屬任務。
-
ReAct能力拆解框架:借鑑ReAct範式,將開放世界探索能力系統拆解爲感知、推理、行動三大維度共14項細粒度指標。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用MineExplorer
- 環境準備:克隆GitHub倉庫至本地,確保已安裝Python 3.9+及Minecraft相關運行環境。
- 啓動評測環境:配置並啓動Minecraft沙盒服務端,確保評測環境可實時運行並接收模型動作指令。
- 運行基準評測:加載MineExplorer提供的813個驗證實例,將待測多模態模型接入環境,模型根據實時畫面輸出動作序列。
- 自動評分:評測結束後,系統自動調用規則化里程碑檢查器,依據揹包物品、座標區域等量化指標計算TSR與MSR得分。
- 自定義任務生成:運行多智能體數據合成腳本,配置任務跳數,由五個協作Agent自動生成含隱藏前置條件的新任務實例。
- 訓練與迭代:將生成任務作爲訓練數據輸入模型,在Minecraft沙盒中反覆執行探索-反饋循環,提升開放世界長程規劃能力。
- 查看結果:評測報告自動輸出各維度得分,支持按模型與難度分層對比。
MineExplorer的核心優勢
-
首創分鐘級開放世界評測:基於實時運行的Minecraft 3D沙盒,模型需在3分鐘動態交互中持續決策。
-
隱藏前置多跳任務:指令僅給最終目標,不枚舉依賴圖,迫使模型自主推斷隱藏子任務。
-
知識解耦設計:主動剝離Minecraft專有機制,保留通用世界常識任務。
-
多智能體高效造題:五Agent協作生成任務,相比單智能體有效率提升約30%,支持1-12跳自定義擴展。
-
規則化自動評測:將子任務轉化爲可自動執行的里程碑檢查器,無需人工標註可量化評分,結果可復現。
MineExplorer的項目地址
- GitHub倉庫:https://github.com/meituan-longcat/MineExplorer
- arXiv技術論文:https://arxiv.org/pdf/2605.30931
MineExplorer的同類競品對比
| 對比維度 | MineExplorer | MineDojo |
|---|---|---|
| 評測目標 | 測通用開放世界探索能力,剝離遊戲專有知識。 | 測具身智能體在Minecraft中的任務完成與互聯網知識利用能力。 |
| 任務設計 | 1-4跳隱藏前置多跳任務,指令不枚舉依賴圖,需自主推斷。 | 數千個程序化與創意任務,指令明確給出目標與步驟。 |
| 知識來源 | 僅依賴通用世界常識,主動過濾Minecraft Wiki機制。 | 深度整合YouTube視頻、Wiki、Reddit等大規模遊戲知識庫。 |
| 數據合成 | 五智能體協作自動生成任務,有效率提升約30%。 | 基於互聯網多模態數據自動構建任務與獎勵函數。 |
| 評測方式 | 規則化里程碑自動檢查器,覆蓋感知/推理/行動14項指標。 | 程序化任務用模擬器狀態判定,創意任務用MINECLIP視頻模型評分。 |
| 開源側重 | 評測基準+可擴展訓練環境,支持1-12跳自定義任務。 | 訓練框架+評測套件,強調從互聯網知識中學習可泛化技能。 |
MineExplorer的應用場景
-
多模態大模型能力評測:爲Claude、GPT、Gemini等頂級MLLM提供動態開放世界長程規劃與推理的標準化考場。
-
Agent訓練環境:作爲Minecraft沙盒練兵場,支持模型在持續交互中提升感知-推理-行動閉環能力。
-
模型選型參考:爲工業界提供開放世界探索能力的橫向對比 leaderboard,輔助選型與能力邊界評估。
-
學術研究平台:推動長程推理、隱式任務分解、視覺 grounding 與行動對齊等前沿方向研究。
-
具身智能預研驗證:爲機器人、自動駕駛等真實物理世界應用提供低成本的能力驗證沙盒。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...