Qwen3.8-Flash – 阿里通義推出的多模態 MoE 模型

AI工具1個月前發佈新公告 AI管理員
0 0

Qwen3.8-Flash是什麼

Qwen3.8-Flash 是阿里雲通義千問推出的多模態 MoE 模型,總參數量 125B,每 token 僅激活 6B,原生支持 262K 上下文。模型採用 GDN+QSA 混合注意力、門控殘差、N-gram 嵌入及 Muon 優化器四大架構創新,訓練成本僅爲 Qwen3.7-Plus 的 1/9,在編碼和辦公任務上能力更強。

Qwen3.8-Flash – 阿里通義推出的多模態 MoE 模型

Qwen3.8-Flash的主要功能

  • 超長上下文處理:原生支持 262K tokens,可擴展至 1M,勝任長文檔與代碼庫分析。
  • 代碼智能體:支持端到端軟件工程任務,包括代碼生成、調試與多語言開發。
  • 辦公自動化:執行長程辦公流程與專業工作任務,集成工具調用能力。
  • 多模態理解:理解長視頻、科學圖表、視覺數學問題及現實世界場景。
  • 設備與界面操控:通過視覺感知操控網頁、Android 設備及桌面操作系統。
  • 推理與問答:覆蓋科學推理、競技編程、指令遵循與多學科綜合推理。

Qwen3.8-Flash的技術原理

  • GDN + QSA Hybrid Attention:模型在每四層中安排三層 Gated DeltaNet 和一層 Qwen Sparse Attention,實現”高效記憶 + 精準查找”的混合注意力機制,在 1M 上下文下 Prefill 吞吐達到前代的 8.6 倍。
  • Gated Residual(GR):將傳統單一殘差流擴展爲四條並行分支,通過動態門控控制各層信息的讀寫比例,保留長距離信息通道,抑制激活異常值,同時支持 FP8 存儲大幅降低訪存開銷。
  • N-gram Embedding:在常規詞嵌入之外,引入 51B 參數的 N-gram 嵌入層,結合局部上下文查表捕捉短語搭配模式;該層可卸載至 Host Memory 並通過異步預取與計算重疊,幾乎不增加 token 級計算量。
  • Muon Optimizer:針對主要線性映射權重採用 Muon 正交化優化,對 Embedding 和 Router 等保留 AdamW;重新擬合 Scaling Law 後支持更大學習率與批次,取消無效的 Batch Size Warmup 策略。

Qwen3.8-Flash – 阿里通義推出的多模態 MoE 模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Qwen3.8-Flash

  • 開源權重部署:從 Hugging Face 下載 Qwen3.8-Flash-Next 權重,在本地或雲端進行推理部署。
  • API 服務調用:通過千問AI平台調用官方 API,輸入 1 元/百萬 tokens、輸出 3 元/百萬 tokens。
  • 千問辦公使用:在”千問辦公”中直接體驗,用於長文檔處理、代碼生成與辦公自動化任務。
  • 查閱技術報告:訪問 GitHub 倉庫中的技術報告,瞭解架構細節與訓練方法以進行深度定製。

Qwen3.8-Flash的核心優勢

  • 極致成本效率:訓練開銷僅爲 Qwen3.7-Plus 的 1/9,API 定價輸入 1 元/百萬 tokens,用極低算力成本實現旗艦級性能。
  • 超長上下文領先:原生 262K 可擴展至 1M tokens,1M 上下文下 Prefill 吞吐達到前代的 8.6 倍,長序列處理速度與精度兼具。
  • Agent 與編碼能力突出:在代碼智能體、軟件工程、長程辦公任務等多項基準上顯著超越同級模型,勝任複雜生產級開發工作。
  • 下一代架構創新:採用 GDN+QSA 混合注意力、門控殘差與 N-gram 嵌入等全新設計,是 Qwen4 系列架構的提前驗證版。
  • 多模態操控能力:支持長視頻理解、視覺網頁開發、Android 及桌面設備操控,實現真正的多模態智能體交互。
  • 開源與工程友好:Flash-Next 權重已開源,GR 支持 FP8、N-gram 嵌入可卸載至 Host Memory,降低部署門檻與顯存佔用。

Qwen3.8-Flash的項目地址

  • 項目官網:https://qwen.ai/blog?id=qwen3.8-flash-next
  • HuggingFace模型庫:https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
  • 技術論文:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

Qwen3.8-Flash的同類競品對比

對比維度 Qwen3.8-Flash-Next DeepSeek-V4-Flash Claude-Opus-4.6
總參數量 125B + 51B N-gram 284B —
激活參數 6B 13B —
Agentic Coding (DeepSWE 1.1) 58.7 54.4 —
SWE-bench Pro 62.5 56.0 53.4
多語言軟件工程 81.0 — 77.5
長程辦公 (CoWorkBench) 73.9 45.1 68.2
專業工作 (JobBench) 55.7 41.3 36.6
科學推理 (GPQA Diamond) 91.7 90.8 91.3
競技編程 (LiveCodeBench) 91.9 90.6 88.8
指令遵循 (IFBench) 81.3 79.2 62.5
多模態工具 (ClawEval-MM) 64.4 / 60.4 — 52.5 / 54.7
移動操控 (AndroidWorld) 84.5 — 62.0
計算機使用 (OSWorld 2.0) 19.4 / 52.3 — —
視覺網頁開發 (Vision2Web) 64.0 — —
具身智能 (ERQA) 72.3 — 40.8
長視頻理解 (LVBench) 76.6 — 63.0
視覺數學 (MathVision w/ CI) 95.7 — 65.5
科學圖表分析 (CharXiv w/ CI) 90.6 — 66.0

Qwen3.8-Flash的應用場

  • 超長文檔與知識庫智能分析:用 1M tokens 超長上下文,對整本技術手冊、法律合同或大型代碼庫進行一次性深度理解與問答,無需分段處理。
  • 端到端軟件開發與代碼維護:作爲代碼智能體(Agentic Coding)完成需求分析、代碼生成、Bug 修復、單元測試編寫及多語言項目維護,覆蓋 SWE-bench 級別複雜任務。
  • 企業辦公流程自動化:執行跨平台長程辦公任務,如自動整理會議紀要、批量處理 Excel 報表、撰寫並排版商業文檔,集成工具調用實現端到端閉環。
  • 多模態內容理解與教育輔導:解析長視頻課程、科學論文圖表、視覺數學題目,提供步驟化講解與答案驗證,支持 STEM 領域的深度教學輔助。
  • 跨設備智能體操控:通過視覺感知與推理能力,自動操控 Android 手機完成 App 測試、在桌面操作系統中執行文件管理,或根據設計稿自動生成可部署的網頁前端。
© 版權聲明

相關文章

暫無評論

暫無評論...