Qwen 3.8-Max – 阿里雲 Qwen 團隊推出的旗艦大模型

AI工具4周前發佈新公告 AI管理員
0 0

Qwen 3.8-Max是什麼

Qwen 3.8-Max 是阿里雲 Qwen 團隊推出的旗艦大模型,總參數量達 2.4 萬億,基於 Qwen 3.5 架構擴展而成。作爲 Qwen 家族迄今最強大的模型,是首個即將開源權重的 Max 級別模型。模型在編程、辦公、科研及長程任務上實現全面升級,支持通過千問AI平台 API 調用,兼容 OpenAI 與 Anthropic 協議,可無縫集成至 Claude Code、Codex、Qoder 等主流智能體框架。

Qwen團隊已開源總參數2.4T、每Token激活95B的MoE大模型Qwen3.8-2.4T-A95B,原生支持256K上下文,在編程與Agent任務上表現領先,爲Qwen-Max級別首次開放權重。

Qwen 3.8-Max – 阿里雲 Qwen 團隊推出的旗艦大模型

Qwen 3.8-Max的主要功能

  • 長程自動編程:支持十天級自主編程,構建自進化 harness 並完成需求收集、issue 派發、代碼生成與自我修復。
  • 論文復現與超越:獨立復現論文實驗後,通過四輪自我進化循環測試 18 種改進想法,在 AIME24 上超越原方法 2.7 分。
  • 競賽實戰:24 小時內獨立搭建並迭代方案,準確率從 0.60 升至 0.853,擊敗 87% 的人類參賽隊伍。
  • 辦公提效:覆蓋數百種高價值職業場景,如律師一小時標出 1,284 條條款、設計師一次成型 8 頁可交互原型。
  • 量化策略研發:從單句描述出發調度約 330 個子智能體,完成約 6,000 次回測,交付端到端 ETF 輪動策略。
  • 芯片自主設計:歷經約 500 輪交互,將密碼加速器網表門數從 8,298 優化至 678,面積縮減 81% 並實現時序閉合。

Qwen 3.8-Max的技術原理

  • 架構擴展:基於 Qwen 3.5 架構基礎擴展而成,總參數量達 2.4 萬億,激活參數 95B,在保持架構繼承性的同時實現規模躍升。
  • 真實世界強化學習系統:通過聯合擴展 RL 環境數量與訓練算力提升通用工作能力,核心解決三個耦合挑戰:在任務、工作空間、Harness三個維度上解耦合,使環境數以組合方式自然增長;構建統一獎勵系統,將基於執行的校驗、文本及渲染後視覺輸出的 rubric 評估、agentic 檢查統一內化,消除任務專用驗證器的不一致性;構建在線數據均衡器,對每個 batch 在任務、難度、工作區與 harness 上重構均衡分佈,降低梯度方差,支撐訓練算力穩定持續擴展。
  • 自進化反饋閉環:模型通過執行-反饋-迭代的自適應機制推進優化,在數百至數千輪交互中保持高度連貫的系統性策略,依賴仿真、綜合、佈局等反饋閉環,實現算法級數據通路重構而非淺層語法微調。
  • 動態工作流編排:用編程方式驅動任務規劃,將編排邏輯固化爲可復現程序,支持從單鏈路連貫研發到大規模並行探索的靈活切換,使複雜任務的串行推進轉化爲一次對話內可規模化交付的自動化閉環。

如何使用Qwen 3.8-Max

  • 千問AI平台調用:註冊賬號獲取 API Key,通過兼容 OpenAI或 Anthropic 協議的接口直接調用模型。
  • 調節推理深度:通過 reasoning_effort 參數設置 xhigh(默認,深度分析)、medium(平衡)或 low(高效推理),按需控制成本與性能。
  • 集成智能體框架:配置 API Key 與 Base URL 後,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流編程助手與 Agent 框架。
  • 開源權重部署:下週起從 Hugging Face 或 ModelScope 下載模型權重,進行本地部署與二次開發。

Qwen 3.8-Max 的核心優勢

  • 超長程自主執行:可連續專注數天至數十天,通過執行-反饋-迭代閉環自我進化,全程無需人工介入。
  • 真實世界 RL 訓練:聯合擴展環境數量與訓練算力,在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等 harness 上表現均衡且持續提升。
  • 端到端交付能力:通過動態工作流將編排邏輯固化爲可復現程序,把原本需數週串行推進的複雜任務壓縮爲一次對話內可規模化交付的自動化閉環。

Qwen 3.8-Max 的項目地址

  • 項目官網:https://qwen.ai/blog?id=qwen3.8
  • 魔搭模型庫:https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B

Qwen 3.8-Max 的同類競品對比

維度 Qwen 3.8-Max GPT 5.6 Sol
論文復現 PaperBench 93.0 分,獨立復現後自我進化超越原文 PaperBench 90.5 分
軟件工程 SWE-bench Pro 67.7 分,FrontierSWE 73.5 分 SWE-bench Pro 64.6 分,FrontierSWE 無官方數據
終端編碼 Terminal Bench 2.1 86.6 分 Terminal Bench 2.1 88.8 分
通用辦公 CoWorkBench 74.8 分,JobBench 53.4 分 CoWorkBench 71.5 分,JobBench 45.4 分
多模態推理 MMMU-Pro 82.3 分,BabyVision 82.0 分 MMMU-Pro 83.0 分,BabyVision 65.5 分
視覺智能體 OSWorld-Verified 86.1 分,AndroidWorld 85.3 分 OSWorld-Verified 83.2 分,AndroidWorld 77.6 分
視頻理解 VideoMME 90.4 分,MLVU 90.8 分 VideoMME 89.5 分,MLVU 87.6 分
長程任務 365 天電商模擬 4.16 倍回報,芯片設計 500 輪優化 無公開同類長程自主任務數據

Qwen 3.8-Max 的應用場景

  • 法律合規審查:單次通讀數百份文檔,一小時內標出上千條相關條款,替代法務團隊約一週工作量。
  • UI/UX 原型設計:爲數字銀行 App 一次生成 8 頁高保真可交互原型,無需人工返修。
  • 餐飲菜單開發:基於上百份食材資料一次性產出 26 道菜的完整菜單,控制食材成本率在 33.8%。
  • 結構工程建模:僅憑一份圖紙在瀏覽器中還原 30 層寫字樓抗震結構模型,支持實時懸停查看關鍵指標。
  • 康復醫學可視化:將 2D 紙質評估單轉化爲可自由旋轉、逐層浮現的 3D 交互演示,幫助患者理解康復路徑。
© 版權聲明

相關文章

暫無評論

暫無評論...