FreeToken – 開源端側 MoE 大模型推理系統,支持滿血運行

AI工具1天前發佈新公告 AI管理員
0 0

FreeToken是什麼

FreeToken 是 UC Berkeley 與 MIT 等機構聯合開源的端側 MoE 大模型推理系統。系統通過全層雙緩衝、帶寬自適應混合調度、Agent 狀態複用及彈性顯存熱擴縮容等技術,將個人電腦的 CPU、內存、PCIe 與 GPU 統一爲彈性計算平台,實現單卡消費級硬件滿血運行 Qwen3.6-35B、DeepSeek-V4-Flash 284B 等超大 MoE 模型,讓本地部署頂尖 AI 成爲現實。

FreeToken – 開源端側 MoE 大模型推理系統,支持滿血運行

FreeToken的主要功能

  • 端側滿血推理:支持在 RTX 4060/5090 等消費級單卡上滿血運行 Qwen3.6-35B、DeepSeek-V4-Flash 284B 等超大 MoE 模型。
  • 全層雙緩衝預取:GPU 計算當前層時,後台通過 PCIe 流式預取下一層 Expert 權重,徹底消除 I/O 等待氣泡。
  • 帶寬自適應調度:實時探測 PCIe 帶寬與 CPU 算力,動態分流未命中 Expert 至 GPU 緩存或 CPU 就地計算,拉到硬件吞吐極限。
  • Agent 狀態複用:在特殊 Token 邊界設置輕量檢查點,上下文編輯時僅從最近錨點增量 Prefill,避免重複計算完整歷史。
  • 彈性顯存熱擴縮:後台應用搶佔顯存時,無縫收縮 GPU Cache 並轉交 CPU 計算,實現 0 停機、不 OOM 的平滑降級。
  • 極速低延遲:首 Token 延遲降低 42–58%,Agent 多輪交互 TTFT 減少 65–80%,整體比 Ollama 快 2–4 倍。

FreeToken的技術原理

  • 全層雙緩衝預取:在 Prompt 處理階段,FreeToken 實現計算與數據搬運的完全重疊,當 GPU 正在計算第 l 層時,第 l+1 層的 Expert 權重已經通過 PCIe 後台預取流式傳輸,基本消除了 I/O 等待氣泡,使得 Prefill 過程不會因爲逐層從系統內存拉取 Expert 產生嚴重阻塞。
  • 帶寬自適應混合調度:運行時系統實時探測本機的 PCIe 實際帶寬與 CPU 瞬時算力,動態計算出最優分流比率,一部分 Expert 命中 GPU 的 LRU 緩存,未命中部分根據實時帶寬智能分流,部分通過 PCIe 傳輸到 GPU,部分直接原地在 CPU 並行計算,將硬件吞吐拉到該拓撲下的理論極限。
  • 面向 Agent 的智能狀態複用:針對 Coding Agent 或工具調用模型頻繁微調上下文的場景,FreeToken 在特殊 Token 邊界設置輕量級檢查點,當上下文發生編輯時,系統僅需從最近的有效錨點恢復並增量 Prefill 新增後綴,無需重新計算整個上下文,大幅減少多輪工具調用與思維鏈迭代中的重複計算開銷。
  • 彈性顯存動態熱擴縮容:針對個人電腦常有其他應用搶佔顯存的現實情況,FreeToken 支持在不重啓 Serving 服務的前提下動態熱調整 GPU 中 Expert Cache 的大小,當可用顯存驟降時無縫收縮緩存並將更多未命中 Expert 轉交 CPU 計算,保證推理服務平滑降級不觸發 CUDA Out of Memory 崩潰。

FreeToken – 開源端側 MoE 大模型推理系統,支持滿血運行

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用FreeToken

  • 桌面 App 安裝:訪問FreeToken官網 https://www.flashml.ai/ 下載 Windows 或 Linux 桌面 App,安裝後通過 GUI 界面即可啓動推理服務。
  • 命令行快速安裝:通過命令行執行 uv pip install "freetoken[accel]" 一鍵完成 CLI 工具的安裝。
  • 模型載入與自動調度:載入支持的 MoE 模型權重,系統會自動完成 CPU-GPU 異構調度與帶寬自適應配置。
  • 硬件配置建議:運行 DeepSeek-V4-Flash 等超大模型時,建議配備 32GB 顯存並搭配 192GB 以上內存保證穩定流暢。
  • 彈性顯存自動管理:使用過程中若後台有遊戲或渲染搶佔顯存,FreeToken 會自動熱擴縮容,無需手動干預或重啓服務。

FreeToken的核心優勢

  • 打破硬件門檻:消費級單卡(如 RTX 4060/5090)即可滿血運行 35B–753B 參數的超大 MoE 模型,無需數據中心集羣。
  • 推理速度領先:比 Ollama 快 2–4 倍,比 llama.cpp 快 1.46 倍,筆記本 RTX 4060 跑 Qwen3.6-35B 可達 39.3 tok/s。
  • 首 Token 延遲極低:通過全層雙緩衝與帶寬自適應調度,將長 Prompt 的 TTFT 降低 42–58%。
  • Agent 交互優化:基於 Token 邊界輕量檢查點與狀態複用,多輪工具調用場景的 TTFT 減少 65–80%。
  • 彈性顯存不崩潰:後台應用搶佔顯存時,可熱擴縮 GPU Cache 並轉交 CPU 計算,實現 0 停機、不 OOM 的平滑降級。
  • 全棧異構協同:將 CPU、系統內存、PCIe 總線與 GPU 統一爲彈性推理平台,自動收斂至硬件拓撲的理論最大吞吐。

FreeToken的項目地址

  • 項目官網:https://www.flashml.ai/
  • GitHub倉庫:https://github.com/FlashML-org/FreeToken
  • arXiv技術論文:https://arxiv.org/pdf/2608.16157

FreeToken的同類競品對比

對比維度 FreeToken Ollama
定位 端側 MoE 專用全棧推理系統 通用本地大模型運行框架
MoE 模型支持 原生深度優化,支持 20+ 種 MoE 模型滿血運行 部分 MoE 模型缺乏支持或無法啓動(如 DSV4-Flash)
推理速度 比 Ollama 快 2–4 倍(RTX 4060 跑 Qwen3.6-35B 達 39.3 tok/s) 基線速度,PCIe 帶寬瓶頸明顯
首 Token 延遲 通過雙緩衝預取降低 TTFT 42–58% 長 Prompt 下逐層拉取 Expert,延遲較高
Agent 多輪交互 狀態複用使 TTFT 減少 65–80% 上下文修改後需重算,延遲累積
顯存彈性 後台搶佔顯存時可熱擴縮容,0 停機不 OOM 顯存不足時直接觸發 CUDA OOM 崩潰
硬件協同 CPU+內存+PCIe+GPU 統一彈性調度 主要依賴 GPU,CPU 卸載效率有限
安裝方式 GUI App / CLI uv pip install "freetoken[accel]" ollama run 命令行一鍵拉取

FreeToken的應用場景

  • 本地 AI Coding Agent:在筆記本或遊戲 PC 上本地運行 Claude Code、OpenClaw 等編程 Agent,支持多輪工具調用與思維鏈迭代,無需聯網可實現智能代碼補全與調試。
  • 端側超大 MoE 模型推理:個人用戶可在 RTX 4060/5090 等消費級單卡上滿血運行 DeepSeek-V4-Flash(284B)、GLM-5.2(753B)等前沿模型,打破數據中心依賴。
  • 高併發多輪對話服務:客服、知識問答等需要頻繁修改上下文的對話場景,利用 Token 邊界檢查點與狀態複用,避免重複計算,顯著降低多輪響應延遲。
  • 遊戲/工作並行的彈性 AI 助手:在後台運行 3D 渲染、遊戲或開發工具時,FreeToken 可自動收縮 GPU 緩存並轉交 CPU 計算,保證 AI 推理服務不中斷、不崩潰。
  • 邊緣設備科研與原型驗證:科研人員可在實驗室普通工作站上快速部署和測試最新開源 MoE 模型,無需申請服務器資源,降低大模型研究門檻。
© 版權聲明

相關文章

暫無評論

暫無評論...