Inkling是什麼
Inkling 是 Thinking Machines Lab 推出的開放權重多模態基礎模型。模型原生支持文本、圖像與音頻輸入,採用混合專家架構,在 410 億激活參數下實現跨模態推理,支持開發者通過 Tinker 平台下載權重、按需微調。與追求單項 benchmark 冠軍的模型不同,Inkling 追求在智能體、編程、視覺、音頻等廣泛任務中保持均衡表現,成爲可嵌入不同工作流的後台推理引擎。

Inkling的主要功能
-
多模態原生理解:同時處理文本、圖像與音頻輸入,支持語音轉寫、視覺問答、圖表推理及長音頻分析。
-
智能體與工具調用:內置多框架工具使用能力,可執行瀏覽器操作、代碼生成、終端任務與多輪協作開發。
-
可控推理強度:支持調節推理深度(effort 參數),在 token 成本與性能間靈活權衡,低延遲場景下仍保持高效。
-
超長上下文處理:最高支持 100 萬 token 上下文,適用於長文檔分析、多輪對話與複雜工作流。
-
開放權重與微調:完整權重通過 Hugging Face 開放,配合 Tinker 平台提供端到端微調與自訓練能力。
Inkling的技術原理
-
MoE 稀疏架構:66 層解碼器-only Transformer,256 位專家中每 token 激活 6 位專家 + 2 位共享專家,總參數 9750 億、激活參數 410 億。
-
無編碼器多模態:圖像經 40×40 像素塊通過四層 hMLP 編碼,音頻以 dMel 頻譜圖離散 token 輸入,所有模態投影至共享隱空間統一解碼。
-
混合注意力機制:局部與全局注意力層交替,平衡長上下文記憶與計算效率。
-
量化部署:支持 BF16、MXFP8 與 NVFP4 精度,NVFP4 量化後僅需 600GB 顯存即可運行。
-
訓練數據:在 45 萬億 token 的文本、圖像、音頻與視頻數據上預訓練,數據經去重、過濾與合成增強。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Inkling
-
在線體驗:訪問 Inkling Playground(Tinker 控制檯)https://tinker.thinkingmachines.ai/playground直接與模型交互,測試風格與能力。
-
API 調用:通過 Tinker 平台或第三方推理服務商接入 API,使用
tml-renderers包快速集成。 -
本地部署:從 Hugging Face 下載權重,使用 SGLang、vLLM、TokenSpeed、Unsloth 或 Hugging Face 框架部署;BF16 需 2TB 顯存,NVFP4 量化版需 600GB。
-
微調定製:在 Tinker 平台上傳數據,編寫微調任務並運行訓練,可讓模型參與自身迭代優化。
-
推理強度調節:通過 effort 參數控制生成 token 數量,匹配成本與性能需求。
Inkling的核心優勢
-
高效推理曲線:在 Terminal Bench 等測試中,用 Nemotron 3 Ultra 三分之一的 token 達到同等性能,顯著降低長流程成本。
-
均衡通才能力:不針對單一領域過擬合,在智能體、編程、視覺、音頻、指令遵循等維度同時保持競爭力。
-
原生多模態:音頻與視覺組件從零開始訓練,非後期拼接,語音與圖像理解在開放權重模型中處於第一梯隊。
-
安全與可控:內置 FORTRESS 安全防護,誤拒率低;支持 Llama Guard 等下游審覈工具疊加,形成縱深防禦。
Inkling的項目地址
- 項目官網:https://thinkingmachines.ai/news/introducing-inkling/
- HuggingFace模型庫:https://huggingface.co/thinkingmachines/Inkling
- 技術論文:https://thinkingmachines.ai/model-card/inkling/
Inkling的同類競品對比
| 維度 | Inkling | GLM 5.2 |
|---|---|---|
| 權重協議 | Apache 2.0 | 開放權重 |
| 多模態支持 | 文本 + 圖像 + 音頻(原生) | 文本 + 圖像 |
| 智能體編程 | Terminal Bench 2.1: 63.8% | Terminal Bench 2.1: 82.7% |
| 視覺推理 | MMMU Pro: 73.5% | MMMU Pro: 60.0% |
| 指令遵循 | IFBench: 79.8% | IFBench: 73.3% |
| 安全對抗 | FORTRESS: 78.0% | FORTRESS: 71.3% |
| 推理效率 | 支持 effort 參數調節,低 token 高性價比 | 固定推理模式 |
Inkling的應用場景
-
企業智能體中樞:作爲後台推理模型,驅動客服、數據分析、代碼生成等多工具協作的智能體系統,通過微調適配企業內部工作流。
-
多模態內容審覈:同步分析文本、圖片與音頻內容,用於社交平台、直播平台的高效合規審查與風險識別。
-
交互式教育助手:基於語音與視覺輸入,爲學生提供實時解題、圖表講解與編程輔導,支持百萬 token 長教材上下文。
-
低延遲編程助手:在 effort 參數調低模式下,以極低延遲完成代碼補全、終端命令生成與輕量 bug 修復,嵌入 IDE 插件。
-
長文檔法律/金融分析:用百萬 token 上下文,對合同、研報、財報進行跨頁關聯推理,提取關鍵條款與風險點。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...