MiniCPM5-2B是什麼
MiniCPM5-2B 是面壁智能、OpenBMB 社區與清華大學聯合開源的端側語言基座模型。模型約25億參數,支持128K上下文,在34項基準均分53.9,超越一衆4B級模型,達2B級開源SOTA。模型將工具調用、深度搜索、代碼生成等Agent能力壓入端側,可運行於6GB內存設備;同時開源訓練數據、RL框架Meshy與JustRL II算法,堪稱端側”小鋼炮”。

MiniCPM5-2B的主要功能
-
端側對話問答:在本地設備上直接運行語言模型,完成日常問答、寫作、總結等任務,數據無需上傳雲端。
-
長文本理解:支持 128K 上下文,可本地處理會議紀要、合同、長文檔並精準提取關鍵信息。
-
代碼生成與修復:從代碼補全到真實倉庫級修復(SWE-bench Verified 46.4),可作爲本地編碼助手。
-
工具調用:原生支持函數調用,能按需調用外部工具完成查詢、計算、數據庫交互等操作。
-
深度搜索:具備搜索 Agent 能力,可自主規劃多步檢索並整合答案。
-
混合推理:通過
enable_thinking開關在快速應答與深度思考模式間切換,兼顧效率與難題求解。 -
本地批量任務:簡歷篩選、試卷批改、合同分析等隱私敏感任務可在設備側低成本並行處理。
MiniCPM5-2B的技術原理
-
標準 Dense Transformer 架構:模型採用標準的 LlamaForCausalLM 結構,共 42 層,使用 GQA降低 KV Cache 開銷,原生支持 131,072 token 上下文,因架構完全標準,vLLM、llama.cpp、Ollama 等主流框架無需自定義 kernel 即可原生加載。
-
全鏈路 Agent 能力培養:Agent 從預訓練階段就針對性鋪路,先進行 200B 規模的 Agent Midtraining 注入任務拆解與工具使用先驗,再用 50 萬條覆蓋工具調用、網頁搜索、代碼 Agent 等場景的 SFT 軌跡教會模型規範執行,最後通過 Agent RL 對齊保證多輪交互中策略穩定,形成”能跑且好用”的完整能力鏈。
-
Meshy 強化學習框架:Meshy 去掉了傳統 RL 訓練的中央控制器與 Ray 依賴,將訓練、推理、獎勵計算全部建模爲對等節點服務,利用 TransferQueue 中的數據就緒狀態驅動實際控制流,可在同步、異步、全異步三種模式間靈活切換,使大規模 RL 訓練更易擴展、部署更輕量。
-
JustRL II 獎勵學習算法:針對端側模型長思維鏈 RL 中”獎勵信號帶偏模型”和”GRPO 信用分配粗糙”兩大痛點,JustRL II 在數據側採用三階段流水線校準訓練樣本,在算法側爲 GRPO 引入 Critic 實現詞元級信用分配,精確區分長推理鏈中每步的貢獻。
-
UltraX 函數調用式數據精煉:UltraX 摒棄大模型端到端重寫網頁文本的傳統做法,改爲訓練一個 0.6B 輕量模型預測結構化的編輯操作,再由確定性執行器逐行落地——既避免重寫帶來的語義漂移與結構破壞,又因編輯操作可保存、可審計而實現全程可追溯,實測 16B tokens 精煉語料的訓練效果即超過原始語料 20B tokens 滿訓表現。
-
UltraData 分級數據治理體系:代碼數據採用 L0–L3 遞進治理,RL 數據經三階段流水線剔除不可驗證、獎勵不可信、難度不匹配的樣本,以高質量數據信號彌補小模型容量劣勢,這是小參數量下能力反超 4B 模型的關鍵工程基礎。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用MiniCPM5-2B
- 確認硬件條件:BF16 原版權重約 4.7GiB,或使用約 1.2GB 的 GGUF 量化版在 6GB 內存的手機、普通筆記本上運行。
- 獲取模型權重:從 HuggingFace或魔搭社區下載所需版本,按需選擇 BF16 / GGUF / MLX / GPTQ / SFT 等格式。
- 安裝推理框架:雲端或高併發場景用 vLLM(≥0.21.0 原生支持,單卡 TP=1 即可),本地輕量部署用 llama.cpp、Ollama 或 SGLang,CPU 環境可用面壁自研的 Arclight 框架。
- 加載並運行模型:以標準 Llama 架構直接加載,無需任何自定義 kernel。
- 切換思考模式:通過聊天模板中的
enable_thinking開關控制快速應答或深度推理,按任務難度選擇模式。 - 接入工具調用/Agent:利用模型原生的函數調用與深度搜索能力,結合配套部署 Cookbook 和 Agent Skills 搭建本地 Agent 工作流。
MiniCPM5-2B的核心優勢
- 2B 級開源 SOTA:34 項基準均分 53.9,反超所有參測 4B 級模型,以小博大。
- 端側通用 Agent 雛形:原生集成工具調用、深度搜索、代碼生成等智能體核心能力,Agent 榜單 20 分居首,領先 Granite 4.2 8B、Qwen3.5 9B 等更大模型。
- 極致部署友好:標準 Llama 架構 + 全格式發佈,vLLM、Ollama、llama.cpp 免改造直接加載,INT4 版僅 1.2GB、6GB 內存設備即可運行。
- 原生 128K 長上下文:13 萬 token 上下文爲端側本地處理會議紀要、合同等長文檔提供能力基礎。
- 全鏈路開源:不止權重,連訓練數據(UltraData 系列)、RL 框架(Meshy)、RL 算法(JustRL II)與訓練 Recipe 一併開放,可完整復現與二次創新。
- 高效推理:單任務平均約 21K output tokens,token 消耗低於同級模型,端側運行更快更省電。
- 芯片生態廣:覆蓋 AMD、英特爾、聯發科、高通及昇騰、海光、崑崙芯、摩爾線程等 9 款國產芯片 Day0 適配。
MiniCPM5-2B的項目地址
- GitHub倉庫:https://github.com/OpenBMB/MiniCPM
- HuggingFace模型庫:https://huggingface.co/collections/openbmb/minicpm5
MiniCPM5-2B的同類競品對比
| 維度 | MiniCPM5-2B | Qwen3.5-2B |
|---|---|---|
| 出品方 | 面壁智能 × OpenBMB × 清華 | 阿里巴巴通義 |
| 參數規模 | 2.52B(非嵌入約1.98B) | 約2B |
| 架構 | Dense,42層,GQA 16Q/2KV | Dense,GQA |
| 原生上下文 | 128K | 128K* |
| 開源協議 | Apache 2.0 | Apache 2.0 |
| 發佈格式 | BF16/GGUF/MLX/GPTQ/SFT/Base | GGUF/BF16等 |
MiniCPM5-2B的應用場景
- 隱私敏感文檔處理:會議紀要、合同、內部郵件在本地完成問答與摘要,數據全程不出設備。
- 招聘與人力資源:本地批量篩選簡歷、提取候選人信息並結構化比對,避免簡歷上傳雲端。
- 端側編碼助手:離線完成代碼補全、調試建議乃至倉庫級缺陷修復,保障代碼資產安全。
- 本地深度搜索:自動規劃多步網頁檢索並整合答案,適用於調研、比價、信息收集。
- 教育與批改:試卷批改、作業講評、錯題分析在本地批量並行,降低學校與教培成本。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...