Gemini 3.8 Live是什麼
Gemini 3.8 Live 是谷歌推出的實時語音對話模型系列,包括Gemini 3.8 Live 面向規模化部署,兼顧對話智能、視覺理解與成本效益;Gemini 3.8 Live Extended Thinking 強化多步推理,可邊推理邊語音播報進度。模型全系採用原生語音對語音架構,支持 97 種語言自動切換與後台異步工具調用,登頂 Artificial Analysis 語音質量指數,生成音頻帶 SynthID 水印,已面向開發者、企業和普通用戶推送。

Gemini 3.8 Live的主要功能
-
實時語音對話:以原生語音對語音方式對話,響應接近實時,在 Speech Agent Arena 用戶偏好度排名第二。
-
異步工具調用:在後台執行 API 和工具調用,同時持續向用戶播報語音回覆,不打斷對話。
-
視覺理解:近實時處理攝像頭畫面,爲對話提供視覺上下文。
-
多語言切換:支持 97 種語言,對話中自動檢測並無縫切換語種。
-
字母數字高精度:準確解析確認碼、理賠號等技術性字符串數據。
-
增量內容更新:將實時音頻與結構化數據無縫融合,返回上下文感知的響應。
Gemini 3.8 Live的技術原理
- 端到端語音對語音架構:模型摒棄了”語音識別→文本大模型→語音合成”的傳統級聯管道,直接用音頻到音頻的方式處理輸入輸出,顯著降低延遲並保留語調、語速等聲學細節,是此前 Gemini 3.1 Flash Live 架構路線的延續升級。
- 並行推理與”邊想邊說”:Extended Thinking 變體採用異步推理機制,在後台進行多步思考的同時繼續流式輸出語音,通過”讓我確認一下…”這類早期口頭提示先確認請求,再實時播報任務進度,實現推理與發言並行而不凍結對話。
- 可配置思考預算:Extended Thinking 支持開發者按需配置思考強度檔位,在複雜任務上投入更多後台推理算力,在簡單對話中壓低延遲與成本,官方定價爲音頻輸入 0.005 美元/分鐘、輸出 0.018 美元/分鐘。
- 全鏈路內容水印:所有生成音頻嵌入 SynthID 隱形水印,直接織入音頻信號本身,即使經過剪輯或壓縮仍可被檢測,用於防範語音僞造與虛假信息傳播。
如何使用Gemini 3.8 Live
Gemini 3.8 Live:
-
開發者:可在 Gemini API 和 Google AI Studio 中使用。
-
企業用戶:Gemini Enterprise 私有預覽中開放。
-
所有用戶:可在 Search Live 中體驗。
Gemini 3.8 Live Extended Thinking:
-
開發者:可在 Gemini API 和 Google AI Studio 中使用。
-
企業用戶:Gemini Enterprise 私有預覽中開放,即將登陸 Gemini Enterprise for Customer Experience 及 Google Workspace 企業客戶。
-
所有用戶:可在 Gemini Live 中體驗;Google AI Pro 和 Ultra 訂閱者可在 Workspace 的 Docs 中使用,所有 Google AI 訂閱者可在 Gmail 和 Keep 中體驗。
Gemini 3.8 Live的核心優勢
-
端到端語音架構:原生語音對語音處理,相比級聯方案延遲更低、更保留語調等聲學細節。
-
成本效益突出:音頻輸入 0.005 美元/分鐘、輸出 0.018 美元/分鐘,適合大規模部署。
-
異步工具調用:後台執行 API 和函數調用,同時持續語音回覆,多步任務不打斷對話。
-
視覺實時理解:可近實時處理攝像頭畫面,實現”能聽會看”的語音智能體。
-
97 種語言自動切換:對話中自動檢測並無縫切換語種,覆蓋全球用戶。
-
並行推理能力:Extended Thinking 變體邊推理邊說,以”讓我確認一下…”等口頭提示保持對話流暢。
-
基準領先:Extended Thinking 登頂 Artificial Analysis 語音質量指數(82.6),Big Bench Audio 得分 97.7%。
Gemini 3.8 Live的同類競品對比
| 對比項 | Gemini 3.8 Live | OpenAI gpt-realtime-2.1 |
|---|---|---|
| 模型架構 | 原生語音對語音,級聯方案的精簡替代 | 原生語音對語音,GPT-5 級推理內置音頻循環 |
| 定價模式 | 按分鐘計費 | 按 token 計費 |
| 音頻輸入成本 | 0.005 美元/分鐘 | 32 美元/百萬 token(約 0.019 美元/分鐘) |
| 音頻輸出成本 | 0.018 美元/分鐘 | 64 美元/百萬 token(約 0.077 美元/分鐘) |
| 典型會話成本 | 約 0.005–0.018 美元/分鐘 | 實際約 0.06–0.11 美元/分鐘,長對話無緩存可達 0.18–0.46 美元/分鐘 |
| 語言支持 | 97 種語言,對話中自動檢測切換 | 實時語音翻譯需單獨模型,支持 70+ 輸入語言至 13 種輸出語言 |
| 視覺理解 | 支持,近實時處理攝像頭畫面(最高約 1 幀/秒) | 未提供同等的實時視覺語音對話能力 |
| 深度推理 | Extended Thinking 變體邊推理邊發言,支持思考檔位配置 | 內置推理循環,但無”邊想邊說”進度播報機制 |
| 基準成績 | AA 語音質量指數第一(82.6),Big Bench Audio 97.7% | Big Bench Audio 較前代提升 15.2% |
| 內容安全 | 全量生成音頻嵌入 SynthID 隱形水印 | 無等效音頻水印機制 |
Gemini 3.8 Live的應用場景
-
員工入職指導:通過攝像頭實時視覺理解,新員工可邊操作邊語音提問,AI 即時解答流程問題。
-
智能客服與銀行業務:結合異步函數調用完成多步驟業務辦理,在後台處理時實時播報進度,對應 τ-Voice-banking 基準測試場景。
-
出行與預訂助手:用戶語音提出多條件需求後,AI 在後台異步調用訂票、酒店 API,邊查詢邊保持自然對話不中斷。
-
編程與設計協作:開發者對着草圖語音描述需求,Extended Thinking 邊推理邊生成可用的 React 組件代碼。
-
實時故障排查:用戶在 Search Live 中語音描述問題,AI 結合視覺畫面逐步語音指導排查與修復。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...