Xiaomi MiMo – 小米開源的首個推理大模型

AI工具7個月前發佈新公告 AI管理員
0 0

Xiaomi MiMo是什麼

Xiaomi MiMo 是小米開源的首個推理(Reasoning)大模型,支持提升模型在複雜推理任務中的表現。模型基於聯動預訓練和後訓練,挖掘大量富推理語料並採用創新的強化學習算法,顯著提升數學推理和代碼生成能力。MiMo 僅用 7B 參數規模,在公開測評集上超越 OpenAI 的 o1-mini 和阿里 Qwen 的 QwQ-32B-Preview 等更大規模模型。Xiaomi MiMo包含4 個模型版本,預訓練模型MiMo-7B-Base、監督微調模型MiMo-7B-SFT、強化學習模型MiMo-7B-RL和MiMo-7B-RL-Zero已開源至 HuggingFace,爲開發者提供強大的推理工具。

小米最新發布的開源大語言模型MiMo-V2-Flash,採用5:1比例的滑動窗口注意力(窗口大小128)與全局注意力交替,減少KV緩存近6倍,兼顧長文本性能與效率。支持並行預測多個token,平均接受長度2.8-3.6,推理速度提升2-2.6倍,尤其優化編碼任務效率。在多項基準測試中媲美DeepSeek-V3.2、Kimi-K2等頭部開源模型。

Xiaomi MiMo – 小米開源的首個推理大模型

Xiaomi MiMo的主要功能

  • 強大的數學推理能力:解決複雜的數學問題,提供準確的推理路徑和答案。
  • 高效的代碼生成能力:生成高質量的代碼,適用於多種編程任務。
  • 優化的推理性能:基於預訓練和後訓練的聯動提升推理能力,用 7B 參數規模超越更大規模的模型,展現出高效的推理性能。

Xiaomi MiMo的技術原理

  • 預訓練階段:着重挖掘富推理語料,合成約 200B tokens 的推理數據,確保模型見過更多推理模式。基於三階段訓練,逐步提升訓練難度,總訓練量達到 25T tokens,模型在不同難度的任務中逐步提升能力。
  • 後訓練階段
    • 強化學習算法:推出 Test Difficulty Driven Reward 算法,緩解困難算法問題中的獎勵稀疏問題,提升模型在複雜任務中的表現。
    • 數據重採樣策略:引入 Easy Data Re-Sampling 策略,穩定強化學習(RL)訓練過程。
    • 高效訓練框架:設計 Seamless Rollout 系統,加速 RL 訓練(2.29 倍)和驗證(1.96 倍),提升訓練效率。
  • 模型架構優化:針對推理任務優化模型架構,確保在有限參數規模下實現高效推理能力。

Xiaomi MiMo的項目地址

  • GitHub倉庫:https://github.com/XiaomiMiMo
  • HuggingFace模型庫:https://huggingface.co/XiaomiMiMo
  • 技術論文:https://github.com/XiaomiMiMo/MiMo/blob/main/MiMo-7B-Technical-Report.pdf

Xiaomi MiMo的應用場景

  • 教育領域:輔助數學解題和編程學習,提供解題步驟和代碼示例。
  • 科研與學術:協助邏輯推理和算法開發,幫助驗證假設和設計實驗。
  • 軟件開發:生成和優化代碼,輔助代碼調試和問題解決。
  • 智能客服:解答覆雜問題,提升問答系統效率。
  • 遊戲娛樂:提供策略建議和智力謎題解答,增加遊戲趣味性。
© 版權聲明

相關文章

暫無評論

暫無評論...