FreeToken是什麼
FreeToken 是 UC Berkeley 與 MIT 等機構聯合開源的端側 MoE 大模型推理系統。系統通過全層雙緩衝、帶寬自適應混合調度、Agent 狀態複用及彈性顯存熱擴縮容等技術,將個人電腦的 CPU、內存、PCIe 與 GPU 統一爲彈性計算平台,實現單卡消費級硬件滿血運行 Qwen3.6-35B、DeepSeek-V4-Flash 284B 等超大 MoE 模型,讓本地部署頂尖 AI 成爲現實。

FreeToken的主要功能
-
端側滿血推理:支持在 RTX 4060/5090 等消費級單卡上滿血運行 Qwen3.6-35B、DeepSeek-V4-Flash 284B 等超大 MoE 模型。
-
全層雙緩衝預取:GPU 計算當前層時,後台通過 PCIe 流式預取下一層 Expert 權重,徹底消除 I/O 等待氣泡。
-
帶寬自適應調度:實時探測 PCIe 帶寬與 CPU 算力,動態分流未命中 Expert 至 GPU 緩存或 CPU 就地計算,拉到硬件吞吐極限。
-
Agent 狀態複用:在特殊 Token 邊界設置輕量檢查點,上下文編輯時僅從最近錨點增量 Prefill,避免重複計算完整歷史。
-
彈性顯存熱擴縮:後台應用搶佔顯存時,無縫收縮 GPU Cache 並轉交 CPU 計算,實現 0 停機、不 OOM 的平滑降級。
-
極速低延遲:首 Token 延遲降低 42–58%,Agent 多輪交互 TTFT 減少 65–80%,整體比 Ollama 快 2–4 倍。
FreeToken的技術原理
- 全層雙緩衝預取:在 Prompt 處理階段,FreeToken 實現計算與數據搬運的完全重疊,當 GPU 正在計算第 l 層時,第 l+1 層的 Expert 權重已經通過 PCIe 後台預取流式傳輸,基本消除了 I/O 等待氣泡,使得 Prefill 過程不會因爲逐層從系統內存拉取 Expert 產生嚴重阻塞。
- 帶寬自適應混合調度:運行時系統實時探測本機的 PCIe 實際帶寬與 CPU 瞬時算力,動態計算出最優分流比率,一部分 Expert 命中 GPU 的 LRU 緩存,未命中部分根據實時帶寬智能分流,部分通過 PCIe 傳輸到 GPU,部分直接原地在 CPU 並行計算,將硬件吞吐拉到該拓撲下的理論極限。
- 面向 Agent 的智能狀態複用:針對 Coding Agent 或工具調用模型頻繁微調上下文的場景,FreeToken 在特殊 Token 邊界設置輕量級檢查點,當上下文發生編輯時,系統僅需從最近的有效錨點恢復並增量 Prefill 新增後綴,無需重新計算整個上下文,大幅減少多輪工具調用與思維鏈迭代中的重複計算開銷。
- 彈性顯存動態熱擴縮容:針對個人電腦常有其他應用搶佔顯存的現實情況,FreeToken 支持在不重啓 Serving 服務的前提下動態熱調整 GPU 中 Expert Cache 的大小,當可用顯存驟降時無縫收縮緩存並將更多未命中 Expert 轉交 CPU 計算,保證推理服務平滑降級不觸發 CUDA Out of Memory 崩潰。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用FreeToken
- 桌面 App 安裝:訪問FreeToken官網 https://www.flashml.ai/ 下載 Windows 或 Linux 桌面 App,安裝後通過 GUI 界面即可啓動推理服務。
- 命令行快速安裝:通過命令行執行
uv pip install "freetoken[accel]"一鍵完成 CLI 工具的安裝。 - 模型載入與自動調度:載入支持的 MoE 模型權重,系統會自動完成 CPU-GPU 異構調度與帶寬自適應配置。
- 硬件配置建議:運行 DeepSeek-V4-Flash 等超大模型時,建議配備 32GB 顯存並搭配 192GB 以上內存保證穩定流暢。
- 彈性顯存自動管理:使用過程中若後台有遊戲或渲染搶佔顯存,FreeToken 會自動熱擴縮容,無需手動干預或重啓服務。
FreeToken的核心優勢
-
打破硬件門檻:消費級單卡(如 RTX 4060/5090)即可滿血運行 35B–753B 參數的超大 MoE 模型,無需數據中心集羣。
-
推理速度領先:比 Ollama 快 2–4 倍,比 llama.cpp 快 1.46 倍,筆記本 RTX 4060 跑 Qwen3.6-35B 可達 39.3 tok/s。
-
首 Token 延遲極低:通過全層雙緩衝與帶寬自適應調度,將長 Prompt 的 TTFT 降低 42–58%。
-
Agent 交互優化:基於 Token 邊界輕量檢查點與狀態複用,多輪工具調用場景的 TTFT 減少 65–80%。
-
彈性顯存不崩潰:後台應用搶佔顯存時,可熱擴縮 GPU Cache 並轉交 CPU 計算,實現 0 停機、不 OOM 的平滑降級。
-
全棧異構協同:將 CPU、系統內存、PCIe 總線與 GPU 統一爲彈性推理平台,自動收斂至硬件拓撲的理論最大吞吐。
FreeToken的項目地址
- 項目官網:https://www.flashml.ai/
- GitHub倉庫:https://github.com/FlashML-org/FreeToken
- arXiv技術論文:https://arxiv.org/pdf/2608.16157
FreeToken的同類競品對比
| 對比維度 | FreeToken | Ollama |
|---|---|---|
| 定位 | 端側 MoE 專用全棧推理系統 | 通用本地大模型運行框架 |
| MoE 模型支持 | 原生深度優化,支持 20+ 種 MoE 模型滿血運行 | 部分 MoE 模型缺乏支持或無法啓動(如 DSV4-Flash) |
| 推理速度 | 比 Ollama 快 2–4 倍(RTX 4060 跑 Qwen3.6-35B 達 39.3 tok/s) | 基線速度,PCIe 帶寬瓶頸明顯 |
| 首 Token 延遲 | 通過雙緩衝預取降低 TTFT 42–58% | 長 Prompt 下逐層拉取 Expert,延遲較高 |
| Agent 多輪交互 | 狀態複用使 TTFT 減少 65–80% | 上下文修改後需重算,延遲累積 |
| 顯存彈性 | 後台搶佔顯存時可熱擴縮容,0 停機不 OOM | 顯存不足時直接觸發 CUDA OOM 崩潰 |
| 硬件協同 | CPU+內存+PCIe+GPU 統一彈性調度 | 主要依賴 GPU,CPU 卸載效率有限 |
| 安裝方式 | GUI App / CLI uv pip install "freetoken[accel]" |
ollama run 命令行一鍵拉取 |
FreeToken的應用場景
-
本地 AI Coding Agent:在筆記本或遊戲 PC 上本地運行 Claude Code、OpenClaw 等編程 Agent,支持多輪工具調用與思維鏈迭代,無需聯網可實現智能代碼補全與調試。
-
端側超大 MoE 模型推理:個人用戶可在 RTX 4060/5090 等消費級單卡上滿血運行 DeepSeek-V4-Flash(284B)、GLM-5.2(753B)等前沿模型,打破數據中心依賴。
-
高併發多輪對話服務:客服、知識問答等需要頻繁修改上下文的對話場景,利用 Token 邊界檢查點與狀態複用,避免重複計算,顯著降低多輪響應延遲。
-
遊戲/工作並行的彈性 AI 助手:在後台運行 3D 渲染、遊戲或開發工具時,FreeToken 可自動收縮 GPU 緩存並轉交 CPU 計算,保證 AI 推理服務不中斷、不崩潰。
-
邊緣設備科研與原型驗證:科研人員可在實驗室普通工作站上快速部署和測試最新開源 MoE 模型,無需申請服務器資源,降低大模型研究門檻。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...