Kimi K3是什麼
Kimi K3 是月之暗面推出的 2.8 萬億參數開源大模型,基於 KDA 混合線性注意力機制與注意力殘差技術構建,原生支持視覺理解,擁有 100 萬 token 上下文窗口。Kimi K3作爲全球首個開源的 3 萬億級別模型,面向長程編程、知識工作和推理等前沿智能場景設計,在編程、Agent 和知識工作評測中達到前沿水平。

Kimi K3的主要功能
-
長程編程:支持理解和處理大型代碼庫,持續完成長時間工程任務,協調使用終端工具。
-
視覺推理:結合軟件工程與視覺推理,利用截圖和視覺反饋優化遊戲開發、前端和 CAD。
-
內核優化:在 GPU 沙箱中獨立分析、重寫並驗證 GPU 內核優化,24 小時內持續迭代。
-
編譯器開發:從零構建類 Triton GPU 編譯器(MiniTriton),實現完整優化到 PTX 代碼生成流水線。
-
交互式創作:融合 3D 推理、編程與視覺能力,將概念轉化爲可玩的交互體驗。
-
芯片設計:基於開源 EDA 工具自主完成芯片構建、優化與驗證,實現模型爲自身服務的芯片設計。
-
科研編程:打通科學文獻與可執行代碼,自主完成複雜計算研究流程的實現、驗證和分析。
Kimi K3的技術原理
- KDA 混合線性注意力機制:Kimi K3 基於 Kimi Delta Attention(KDA)構建,一種混合線性注意力機制,通過讓信息在更長序列和更深模型中更順暢地流動,提升長上下文處理能力。
- 注意力殘差(Attention Residuals):模型引入 Attention Residuals 技術,使深層網絡中的信息傳遞更穩定,緩解隨着模型深度增加可能出現的梯度衰減問題。
- Stable LatentMoE 稀疏架構:採用 Mixture of Experts(MoE)架構,結合 Stable LatentMoE 框架,在 896 個專家中僅高效激活 16 個,大幅提升計算效率與參數利用率。
- 原生視覺與長上下文支持:模型原生支持視覺理解,具備 100 萬 token 的上下文窗口,可同時處理超長文本與多模態輸入。
如何使用Kimi K3
- 官方入口:訪問 Kimi、最新版 Kimi 手機 App 或 Kimi Work 桌面客戶端,可直接調用 Kimi K3 模型進行對話。
- 編程專用:通過 Kimi Code 客戶端使用 K3,專爲長程編程、代碼庫理解和終端工具協調等開發場景優化。
- API 接入:調用 Kimi API 將 K3 集成到自有應用或工作流中,支持自動化任務與第三方系統對接。
- 思考強度調節:當前默認開啓 max(極致)思考模式,後續更新將支持 low 和 high 兩種強度,可按任務複雜度靈活切換。
Kimi K3的核心優勢
-
規模領先:全球首個開源 3 萬億級別模型,過去 12 個月中 9 個月保持開源模型規模上限。
-
長程自主:在長時間工程任務中表現穩定,支持 24 小時自主內核優化和 48 小時芯片設計 Agent 運行。
-
成本效率:在 Kimi Code Bench 和 BrowseComp 等評測中,用更低成本達到接近頂級閉源模型的性能。
-
視覺閉環:支持代碼與實時截圖之間的無縫迭代,實現真正的視覺反饋優化(vision in the loop)。
-
端到端科研:可自主閱讀文獻、實現數值流程、發現已發表公式中的不一致並生成交互式儀表盤。
Kimi K3的項目地址
完整模型權重將於 2026 年 7 月 27 日前發佈。
Kimi K3的同類競品對比
| 維度 | Kimi K3 | Claude Fable 5 |
|---|---|---|
| 參數規模 | 2.8T(開源) | 閉源 |
| Terminal Bench | 88.3(第一) | 84.6 |
| DeepSWE | 67.5 | 70.0(第一) |
| FrontierSWE | 81.2(第二) | 86.6(第一) |
| Program Bench | 77.8(第一) | 76.8 |
| SWE Marathon | 42.0(第一) | 35.0 |
| BrowseComp | 91.2(第一) | 88.0 |
| GDPval-AA | 1668.0 | 1760.0(第一) |
| JobBench | 52.9(第二) | 57.4(第一) |
| CharXiv | 91.3(第二) | 93.5(第一) |
| Zerobench | 41.0(第二) | 46.0(第一) |
| Automation Bench | 30.8(第一) | 29.1 |
| SpreadsheetBench 2 | 34.8(第一) | 34.7(第二) |
| 開源生態 | 完全開源 | 閉源 |
Kimi K3的應用場景
-
大型軟件工程:模型可獨立分析和重構大型代碼庫,持續完成需要數小時甚至數天的複雜開發任務。
-
GPU 內核與編譯器優化:爲高性能計算場景自動優化 GPU 內核或從零構建領域專用編譯器。
-
交互式 3D 內容開發:結合視覺反饋快速迭代,將概念轉化爲可玩的 3D 遊戲、模擬器或可視化作品。
-
科研計算與數據分析:自主閱讀文獻、復現數值流程、評估大量狀態方程並生成交互式結果儀表盤。
-
硬件芯片設計:基於開源 EDA 工具鏈自主完成芯片架構設計、優化與驗證,實現模型爲自身服務的芯片設計。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...