Qwen3.8-LiveTranslate – 阿里通義推出的實時同聲傳譯模型

AI工具14小時前發佈新公告 AI管理員
0 0

Qwen3.8-LiveTranslate是什麼

Qwen3.8-LiveTranslate是阿里通義千問推出的實時同聲傳譯大模型,採用Interleave架構重構,字均延遲從2.8秒降至2.3秒,支持60種語言。模型具備實時說話人分離與音色克隆、原文譯文同幀同出、長上下文消歧三大能力,可識別視頻/音頻輸入,端到端輸出雙語文本及保留原音色的譯文語音,適用跨國會議、跨境直播、視頻本地化等場景,已通過千問AI平台開放API。

Qwen3.8-LiveTranslate – 阿里通義推出的實時同聲傳譯模型

Qwen3.8-LiveTranslate的主要功能

  • 實時同傳:基於Interleave架構的音頻-文本單流處理,字均延遲僅2.3秒,邊聽邊譯。
  • 說話人分離:多人交替發言時自動區分各說話人,並分別復刻其音色生成譯文語音。
  • 雙語同幀輸出:原文與譯文同步同屏呈現,便於即時理解與原文覈對。
  • 長上下文消歧:結合前文語境理解當前語句,讓人名、術語、指代翻譯更準確一致。
  • 多語言互譯:支持60種語言識別輸入、29種語言語音輸出。
  • 視覺信息輔助:支持視頻/圖像輸入,藉助畫面內容輔助翻譯消歧。

Qwen3.8-LiveTranslate的技術原理

  • Interleave 單流架構:Qwen3.8-LiveTranslate 將同傳重構爲音頻與文本交織的單流形式,已聽音頻和已出譯文均緩存複用,避免每句話從頭處理,在提升翻譯質量的同時將字均延遲從 2.8 秒壓縮至 2.3 秒。
  • Thinker–Talker 雙模塊設計:模型採用基於 Hybrid MoE 的 Thinker–Talker 結構。Thinker 將視頻、音頻、原文與譯文編排進同一條因果序列,按時序交替排列、端到端完成理解與翻譯;Talker 結合譯文與源音頻,合成保留原說話人音色的譯文語音。
  • 實時說話人分離:面對多人交替發言場景,模型在翻譯前先完成 Diarization,將每句話歸屬到具體說話人,並據此指導 Talker 爲該說話人穩定復刻其音色,保證譯文語音”聽得出是誰說的”。
  • 長上下文消歧:模型將歷史對話納入上下文建模,跨輪關聯前文信息,避免僅憑單句判斷導致專有名詞、人名、指代出現歧義,保證多人長對話中術語與表達的前後一致。
  • 雙語同步輸出機制:架構設計上原文與譯文在同一條交織序列中對齊生成,天然支持同幀同出,使雙語字幕、內容整理與檢索等下游應用無需額外對齊處理。

如何使用Qwen3.8-LiveTranslate

方式一:在線體驗
  • 打開網址 https://omni.qwen.ai/live-translate。
  • 允許麥克風權限,選擇源語言和目標語言。
  • 直接開始說話,可看到實時雙語字幕並聽到譯文朗讀。
方式二:API 使用
  • 登錄千問 AI 平台,獲取 API Key。
  • 調用 https://www.qianwenai.com/models/qwen3.8-livetranslate-flash-realtime 模型的實時接口,傳入音頻流。
  • 接收返回的雙語文本和譯文語音即可。

Qwen3.8-LiveTranslate的核心優勢

  • 低延遲:Interleave 架構讓字均延遲從 2.8 秒降至 2.3 秒,已聽音頻和已出譯文可緩存複用,翻譯更快更流暢。
  • 說話人分離 + 音色克隆:多人交替發言時精準區分說話人,譯文語音分別復刻各自音色,交流信息歸屬清晰。
  • 雙語同幀同出:原文與譯文同步呈現,兼顧即時理解與原文覈對,天然適配字幕、內容整理、檢索等場景。
  • 長上下文消歧:跨輪關聯歷史語境,解決單句判斷的歧義問題,人名、術語翻譯前後一致更精準。
  • 60 種語言廣覆蓋:支持 60 種語言識別、29 種語言語音輸出,滿足多語種實時交流需求。

Qwen3.8-LiveTranslate的同類競品對比

對比維度 Qwen3.8-LiveTranslate GPT-4o(OpenAI Realtime API)
產品定位 端到端同聲傳譯大模型 通用實時語音對話模型
架構 Interleave 音頻-文本單流,Hybrid MoE Thinker–Talker 雙模塊 端到端多模態大模型,語音直接進、語音直接出
同傳延遲 字均延遲 2.3 秒(LAAL),專爲同傳優化 近實時對話,無官方同傳延遲指標
說話人分離 ✅ 原生支持,多人發言自動區分 有限,依賴 VAD 輪次切分
音色克隆 ✅ 分說話人復刻原音色朗讀譯文 ❌ 輸出爲固定風格語音,不支持音色克隆
雙語同幀輸出 ✅ 原文譯文同步對齊輸出 ❌ 僅輸出單語回應
長上下文消歧 ✅ 跨輪關聯歷史語境,人名術語一致 依賴對話記憶,無針對性消歧優化
語種覆蓋 60 種語言識別 / 29 種語音輸出 約 50+ 種語言對話
視覺輸入 ✅ 支持視頻/圖像輔助消歧 ✅ 支持圖像輸入,但語音模式下較少使用
接入方式 千問 AI 平台 / 阿里雲百鍊 WebSocket API OpenAI Realtime API(WebSocket/WebRTC)
典型場景 跨國會議、跨境直播、字幕翻譯、視頻本地化 語音助手、實時口語對話陪練

Qwen3.8-LiveTranslate的應用場景

  • 跨國會議:多人發言時自動區分說話人並復刻音色實時翻譯,讓與會者彷彿在同語種交流。
  • 跨境直播:爲主播輸出雙語同步字幕和譯文語音,幫助直播內容無障礙觸達全球觀衆。
  • 視頻本地化:輸入視頻即可生成對齊的雙語字幕和配音,大幅簡化影視、課程內容的譯製流程。
  • 國際展會/會展:爲參展雙方的現場交流提供低延遲同傳,減少專業譯員成本。
  • 出海企業客服與培訓:支撐海外客戶的實時語音諮詢和跨語種員工培訓,提升全球化服務效率。
© 版權聲明

相關文章

暫無評論

暫無評論...