Qwen3.8-Flash是什麼
Qwen3.8-Flash 是阿里雲通義千問推出的多模態 MoE 模型,總參數量 125B,每 token 僅激活 6B,原生支持 262K 上下文。模型採用 GDN+QSA 混合注意力、門控殘差、N-gram 嵌入及 Muon 優化器四大架構創新,訓練成本僅爲 Qwen3.7-Plus 的 1/9,在編碼和辦公任務上能力更強。

Qwen3.8-Flash的主要功能
-
超長上下文處理:原生支持 262K tokens,可擴展至 1M,勝任長文檔與代碼庫分析。
-
代碼智能體:支持端到端軟件工程任務,包括代碼生成、調試與多語言開發。
-
辦公自動化:執行長程辦公流程與專業工作任務,集成工具調用能力。
-
多模態理解:理解長視頻、科學圖表、視覺數學問題及現實世界場景。
-
設備與界面操控:通過視覺感知操控網頁、Android 設備及桌面操作系統。
-
推理與問答:覆蓋科學推理、競技編程、指令遵循與多學科綜合推理。
Qwen3.8-Flash的技術原理
- GDN + QSA Hybrid Attention:模型在每四層中安排三層 Gated DeltaNet 和一層 Qwen Sparse Attention,實現”高效記憶 + 精準查找”的混合注意力機制,在 1M 上下文下 Prefill 吞吐達到前代的 8.6 倍。
- Gated Residual(GR):將傳統單一殘差流擴展爲四條並行分支,通過動態門控控制各層信息的讀寫比例,保留長距離信息通道,抑制激活異常值,同時支持 FP8 存儲大幅降低訪存開銷。
- N-gram Embedding:在常規詞嵌入之外,引入 51B 參數的 N-gram 嵌入層,結合局部上下文查表捕捉短語搭配模式;該層可卸載至 Host Memory 並通過異步預取與計算重疊,幾乎不增加 token 級計算量。
- Muon Optimizer:針對主要線性映射權重採用 Muon 正交化優化,對 Embedding 和 Router 等保留 AdamW;重新擬合 Scaling Law 後支持更大學習率與批次,取消無效的 Batch Size Warmup 策略。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Qwen3.8-Flash
-
開源權重部署:從 Hugging Face 下載 Qwen3.8-Flash-Next 權重,在本地或雲端進行推理部署。
-
API 服務調用:通過千問AI平台調用官方 API,輸入 1 元/百萬 tokens、輸出 3 元/百萬 tokens。
-
千問辦公使用:在”千問辦公”中直接體驗,用於長文檔處理、代碼生成與辦公自動化任務。
-
查閱技術報告:訪問 GitHub 倉庫中的技術報告,瞭解架構細節與訓練方法以進行深度定製。
Qwen3.8-Flash的核心優勢
-
極致成本效率:訓練開銷僅爲 Qwen3.7-Plus 的 1/9,API 定價輸入 1 元/百萬 tokens,用極低算力成本實現旗艦級性能。
-
超長上下文領先:原生 262K 可擴展至 1M tokens,1M 上下文下 Prefill 吞吐達到前代的 8.6 倍,長序列處理速度與精度兼具。
-
Agent 與編碼能力突出:在代碼智能體、軟件工程、長程辦公任務等多項基準上顯著超越同級模型,勝任複雜生產級開發工作。
-
下一代架構創新:採用 GDN+QSA 混合注意力、門控殘差與 N-gram 嵌入等全新設計,是 Qwen4 系列架構的提前驗證版。
-
多模態操控能力:支持長視頻理解、視覺網頁開發、Android 及桌面設備操控,實現真正的多模態智能體交互。
-
開源與工程友好:Flash-Next 權重已開源,GR 支持 FP8、N-gram 嵌入可卸載至 Host Memory,降低部署門檻與顯存佔用。
Qwen3.8-Flash的項目地址
- 項目官網:https://qwen.ai/blog?id=qwen3.8-flash-next
- HuggingFace模型庫:https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
- 技術論文:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
Qwen3.8-Flash的同類競品對比
| 對比維度 | Qwen3.8-Flash-Next | DeepSeek-V4-Flash | Claude-Opus-4.6 |
|---|---|---|---|
| 總參數量 | 125B + 51B N-gram | 284B | — |
| 激活參數 | 6B | 13B | — |
| Agentic Coding (DeepSWE 1.1) | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| 多語言軟件工程 | 81.0 | — | 77.5 |
| 長程辦公 (CoWorkBench) | 73.9 | 45.1 | 68.2 |
| 專業工作 (JobBench) | 55.7 | 41.3 | 36.6 |
| 科學推理 (GPQA Diamond) | 91.7 | 90.8 | 91.3 |
| 競技編程 (LiveCodeBench) | 91.9 | 90.6 | 88.8 |
| 指令遵循 (IFBench) | 81.3 | 79.2 | 62.5 |
| 多模態工具 (ClawEval-MM) | 64.4 / 60.4 | — | 52.5 / 54.7 |
| 移動操控 (AndroidWorld) | 84.5 | — | 62.0 |
| 計算機使用 (OSWorld 2.0) | 19.4 / 52.3 | — | — |
| 視覺網頁開發 (Vision2Web) | 64.0 | — | — |
| 具身智能 (ERQA) | 72.3 | — | 40.8 |
| 長視頻理解 (LVBench) | 76.6 | — | 63.0 |
| 視覺數學 (MathVision w/ CI) | 95.7 | — | 65.5 |
| 科學圖表分析 (CharXiv w/ CI) | 90.6 | — | 66.0 |
Qwen3.8-Flash的應用場
-
超長文檔與知識庫智能分析:用 1M tokens 超長上下文,對整本技術手冊、法律合同或大型代碼庫進行一次性深度理解與問答,無需分段處理。
-
端到端軟件開發與代碼維護:作爲代碼智能體(Agentic Coding)完成需求分析、代碼生成、Bug 修復、單元測試編寫及多語言項目維護,覆蓋 SWE-bench 級別複雜任務。
-
企業辦公流程自動化:執行跨平台長程辦公任務,如自動整理會議紀要、批量處理 Excel 報表、撰寫並排版商業文檔,集成工具調用實現端到端閉環。
-
多模態內容理解與教育輔導:解析長視頻課程、科學論文圖表、視覺數學題目,提供步驟化講解與答案驗證,支持 STEM 領域的深度教學輔助。
-
跨設備智能體操控:通過視覺感知與推理能力,自動操控 Android 手機完成 App 測試、在桌面操作系統中執行文件管理,或根據設計稿自動生成可部署的網頁前端。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...