Gemini 3.8 Live – 谷歌推出的原生實時語音對話模型

AI工具2周前發佈新公告 AI管理員
0 0

Gemini 3.8 Live是什麼

Gemini 3.8 Live 是谷歌推出的實時語音對話模型系列,包括Gemini 3.8 Live 面向規模化部署,兼顧對話智能、視覺理解與成本效益;Gemini 3.8 Live Extended Thinking 強化多步推理,可邊推理邊語音播報進度。模型全系採用原生語音對語音架構,支持 97 種語言自動切換與後台異步工具調用,登頂 Artificial Analysis 語音質量指數,生成音頻帶 SynthID 水印,已面向開發者、企業和普通用戶推送。

Gemini 3.8 Live – 谷歌推出的原生實時語音對話模型

Gemini 3.8 Live的主要功能

  • 實時語音對話:以原生語音對語音方式對話,響應接近實時,在 Speech Agent Arena 用戶偏好度排名第二。
  • 異步工具調用:在後台執行 API 和工具調用,同時持續向用戶播報語音回覆,不打斷對話。
  • 視覺理解:近實時處理攝像頭畫面,爲對話提供視覺上下文。
  • 多語言切換:支持 97 種語言,對話中自動檢測並無縫切換語種。
  • 字母數字高精度:準確解析確認碼、理賠號等技術性字符串數據。
  • 增量內容更新:將實時音頻與結構化數據無縫融合,返回上下文感知的響應。

Gemini 3.8 Live的技術原理

  • 端到端語音對語音架構:模型摒棄了”語音識別→文本大模型→語音合成”的傳統級聯管道,直接用音頻到音頻的方式處理輸入輸出,顯著降低延遲並保留語調、語速等聲學細節,是此前 Gemini 3.1 Flash Live 架構路線的延續升級。
  • 並行推理與”邊想邊說”:Extended Thinking 變體採用異步推理機制,在後台進行多步思考的同時繼續流式輸出語音,通過”讓我確認一下…”這類早期口頭提示先確認請求,再實時播報任務進度,實現推理與發言並行而不凍結對話。
  • 可配置思考預算:Extended Thinking 支持開發者按需配置思考強度檔位,在複雜任務上投入更多後台推理算力,在簡單對話中壓低延遲與成本,官方定價爲音頻輸入 0.005 美元/分鐘、輸出 0.018 美元/分鐘。
  • 全鏈路內容水印:所有生成音頻嵌入 SynthID 隱形水印,直接織入音頻信號本身,即使經過剪輯或壓縮仍可被檢測,用於防範語音僞造與虛假信息傳播。

如何使用Gemini 3.8 Live

Gemini 3.8 Live:
  • 開發者:可在 Gemini API 和 Google AI Studio 中使用。
  • 企業用戶:Gemini Enterprise 私有預覽中開放。
  • 所有用戶:可在 Search Live 中體驗。
Gemini 3.8 Live Extended Thinking:
  • 開發者:可在 Gemini API 和 Google AI Studio 中使用。
  • 企業用戶:Gemini Enterprise 私有預覽中開放,即將登陸 Gemini Enterprise for Customer Experience 及 Google Workspace 企業客戶。
  • 所有用戶:可在 Gemini Live 中體驗;Google AI Pro 和 Ultra 訂閱者可在 Workspace 的 Docs 中使用,所有 Google AI 訂閱者可在 Gmail 和 Keep 中體驗。

Gemini 3.8 Live的核心優勢

  • 端到端語音架構:原生語音對語音處理,相比級聯方案延遲更低、更保留語調等聲學細節。
  • 成本效益突出:音頻輸入 0.005 美元/分鐘、輸出 0.018 美元/分鐘,適合大規模部署。
  • 異步工具調用:後台執行 API 和函數調用,同時持續語音回覆,多步任務不打斷對話。
  • 視覺實時理解:可近實時處理攝像頭畫面,實現”能聽會看”的語音智能體。
  • 97 種語言自動切換:對話中自動檢測並無縫切換語種,覆蓋全球用戶。
  • 並行推理能力:Extended Thinking 變體邊推理邊說,以”讓我確認一下…”等口頭提示保持對話流暢。
  • 基準領先:Extended Thinking 登頂 Artificial Analysis 語音質量指數(82.6),Big Bench Audio 得分 97.7%。

Gemini 3.8 Live的同類競品對比

對比項 Gemini 3.8 Live OpenAI gpt-realtime-2.1
模型架構 原生語音對語音,級聯方案的精簡替代 原生語音對語音,GPT-5 級推理內置音頻循環
定價模式 按分鐘計費 按 token 計費
音頻輸入成本 0.005 美元/分鐘 32 美元/百萬 token(約 0.019 美元/分鐘)
音頻輸出成本 0.018 美元/分鐘 64 美元/百萬 token(約 0.077 美元/分鐘)
典型會話成本 約 0.005–0.018 美元/分鐘 實際約 0.06–0.11 美元/分鐘,長對話無緩存可達 0.18–0.46 美元/分鐘
語言支持 97 種語言,對話中自動檢測切換 實時語音翻譯需單獨模型,支持 70+ 輸入語言至 13 種輸出語言
視覺理解 支持,近實時處理攝像頭畫面(最高約 1 幀/秒) 未提供同等的實時視覺語音對話能力
深度推理 Extended Thinking 變體邊推理邊發言,支持思考檔位配置 內置推理循環,但無”邊想邊說”進度播報機制
基準成績 AA 語音質量指數第一(82.6),Big Bench Audio 97.7% Big Bench Audio 較前代提升 15.2%
內容安全 全量生成音頻嵌入 SynthID 隱形水印 無等效音頻水印機制

Gemini 3.8 Live的應用場景

  • 員工入職指導:通過攝像頭實時視覺理解,新員工可邊操作邊語音提問,AI 即時解答流程問題。
  • 智能客服與銀行業務:結合異步函數調用完成多步驟業務辦理,在後台處理時實時播報進度,對應 τ-Voice-banking 基準測試場景。
  • 出行與預訂助手:用戶語音提出多條件需求後,AI 在後台異步調用訂票、酒店 API,邊查詢邊保持自然對話不中斷。
  • 編程與設計協作:開發者對着草圖語音描述需求,Extended Thinking 邊推理邊生成可用的 React 組件代碼。
  • 實時故障排查:用戶在 Search Live 中語音描述問題,AI 結合視覺畫面逐步語音指導排查與修復。
© 版權聲明

相關文章

暫無評論

暫無評論...