Qwen3.8-Omni-Flash – 阿里千問推出的原生全模態模型

AI工具2周前發佈新公告 AI管理員
0 0

Qwen3.8-Omni-Flash是什麼

Qwen3.8-Omni-Flash是阿里千問推出的原生全模態模型,支持文本、圖像、音頻、視頻輸入及1M長上下文,主打”從理解到交付”的Agent能力,可自主完成視頻剪輯、MV創作、短劇翻譯、電影解說、會議紀要執行等端到端工作流。相比上代平均提升超25%,API音頻輸入價格降幅超98%,並開源Qwen-MM-Plugins與Qwen-Live Harness兩大配套框架。

Qwen3.8-Omni-Flash – 阿里千問推出的原生全模態模型

Qwen3.8-Omni-Flash的主要功能

  • 可控音視頻 Caption:用戶可自由指定描述對象、時間範圍、信息粒度與輸出格式,實現”用戶想知道什麼”而非”模型看到了什麼”。
  • Agentic 長音視頻理解:從問題出發自主決定看哪裏、聽什麼,通過由粗到細的多輪取證定位關鍵信息,準確率提升的同時 token 消耗降低約 45.7%。
  • 長會議理解與執行:原生支持一小時音視頻輸入,端到端完成說話人切分、轉錄、身份對齊、紀要生成與待辦執行。
  • 音視頻深度研究:結合視頻內容與用戶需求,自動檢索多模態資料,生成以視頻爲中心的圖文並茂研究報告。
  • Music2MV:細粒度理解歌曲結構、節奏與情緒,輸出帶時間戳歌詞,貫穿音樂理解到成片質檢的完整 MV 創作流程。
  • 短劇翻譯:一句話完成角色台詞識別、口語化翻譯、音色克隆配音、音軌重混與質檢,實現譯製自動化交付。
  • 長電影解說:輸入影片與一句話需求,自動完成全片理解、情節提煉、解說文案、配音配樂、剪輯渲染與質檢。
  • Video2Note:將數小時視頻壓縮爲圖文對應、帶時間戳的 PDF 筆記,並自動審閱迭代修正。
  • Omni Skill Creator:從操作演示或專家教學中提煉 SOP,轉化爲經校驗的可複用 Agent Skill。
  • 實時口語陪練:聯合建模發音與語義,理解口音偏差並實時生成標準發音示範。

Qwen3.8-Omni-Flash的技術原理

  • 原生全模態統一架構:模型在單一架構內聯合建模文本、圖像、音頻與視頻,通過模態對齊的編碼與統一的表示空間實現跨模態理解,保持與同尺寸純文本模型相當的文本能力;1M token 長上下文使其能原生容納數小時音視頻輸入,避免分段處理導致的信息割裂。
  • Agentic 按需感知與取證:模型先粗粒度掃描定位候選片段,再細粒度調取相關音畫內容進行覈對,形成由粗到細的多輪取證鏈,將計算與 token 預算集中於真正相關的片段。
  • 音視頻與 Agent 環境協同:長音視頻 Agent 化的瓶頸在於 harness 缺乏原生音視頻支持,因此官方以模型 + 工具鏈協同演進:Qwen-MM-Plugins 提供按需感知、工具調用與工作流執行能力,接入 Claude Code、OpenClaw 等主流 Agent 框架,將素材理解、任務規劃、工具執行與結果交付串成完整鏈路。
  • 多說話人音畫協同識別:模型聯合建模畫面與音頻流,利用視覺信息(人物在畫面中的出現與開口狀態)輔助消解音頻中的指代與實體歧義,端到端完成說話人切分、語音轉錄與身份對齊,這使多人交替發言、聲音重疊的會議場景識別指標大幅優化。
  • 實時流式交互架構:Qwen3.8-Omni-Flash-Realtime 通過 WebSocket/WebRTC 接收音視頻流,在輸入的同時完成感知與響應,首 token 延遲約 600-980ms、音頻生成 RTF 約 0.153;口語糾正依賴發音與語義的聯合建模,模型在新一輪語音到來時持續更新判斷,區分影響理解的錯誤與自然口音。

Qwen3.8-Omni-Flash – 阿里千問推出的原生全模態模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Qwen3.8-Omni-Flash

  • 網頁直接用:打開千問 AI 平台https://www.qianwenai.com/models/qwen3.8-omni-flash,搜索 qwen3.8-omni-flash,上傳視頻/音頻/圖片就能對話。
  • API 調用:申請阿里雲 DashScope 的 API Key,用兼容 OpenAI 的接口調用,傳圖片、音頻、視頻鏈接加文字問題即可。
  • 裝插件讓它幹活:在 Claude Code、Qwen Code 等工具裏裝 Qwen-MM-Plugins,然後像聊天一樣說”@視頻.mp4 幫我做成解說視頻”,AI自動完成全流程。

Qwen3.8-Omni-Flash的核心優勢

  • 全模態統一:文本、圖像、音頻、視頻一個模型全搞定,支持 1M 超長上下文,一小時長視頻可原生輸入。
  • 從理解到交付:不只是”看懂”音視頻,還能自主規劃、調用工具、產出成片和文檔,完成端到端任務。
  • Agent 能力突出:音視頻 Agent 基準大幅領先,WildClawBench-MM 較上代提升 36.5 分,長程任務達 UniClawBench 69.6 高分。
  • 音頻能力反超 Gemini:60 項語言語音識別、39 種中文方言、多說話人識別指標全面優於 Gemini 3.8 Flash。
  • 效率更高更省:Agentic 取證讓長視頻理解 token 消耗降低約 45.7%,準確不降反升。
  • 價格大幅降低:API 每小時音頻輸入降價超 98%,音視頻輸入降價超 93%,規模化使用成本壓力大減。
  • 開源配套完善:Qwen-MM-Plugins 和 Qwen-Live Harness 全部開源,兼容 Claude Code、OpenClaw 等主流 Agent 框架。

Qwen3.8-Omni-Flash的項目地址

  • GitHub倉庫:
    • Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
    • Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness

Qwen3.8-Omni-Flash的同類競品對比

對比維度 Qwen3.8-Omni-Flash Gemini 3.8 Flash
上下文窗口 1M token 1M token
音視頻理解(OmniVideoBench) 63.4 65.2 ✅
長視頻推理(LVOmniBench) 63.3 70.7 ✅
多說話人識別(AliMeeting DER) 3.4 ✅ 72.6
多語言ASR(FLEURS WER) 9.3 7.9 ✅
中文方言支持 39種方言 ✅ 明顯更少
音視頻Agent(WildClawBench-MM) 71.0 ✅ 58.9
成本 音頻輸入降價98%+,價格優勢大 ✅ 明顯更貴

Qwen3.8-Omni-Flash的應用場景

  • 視頻內容生產:輸入一句需求,自動完成電影解說、MV 製作、短劇翻譯配音的端到端交付。
  • 會議效率工具:上傳一小時會議錄像,自動生成紀要、待辦事項,甚至直接發郵件、建任務。
  • 學習知識沉澱:把幾小時教程視頻自動壓縮成帶截圖和時間戳的 PDF 筆記。
  • 視頻深度研究:針對視頻內容自動檢索全網圖文資料,生成圖文並茂的深度研究報告。
  • 實時交互服務:實時口語陪練、智能客服、聽聲辨位導航等低延遲音視頻交互場景。
© 版權聲明

相關文章

暫無評論

暫無評論...