Gemini 3.5 Transcribe是什麼
Gemini 3.5 Transcribe 是 Google 推出的最新語音轉文本模型,支持實時流式和預錄音頻處理兩種模式,前者通過 Live API 實現亞秒級延遲,後者支持說話人歸屬與詞級時間戳。Gemini 3.5 Transcribe 能自動清理填充詞與自我糾正、識別 85 種以上語言及實時語言切換、自定義專業詞彙,詞錯誤率低至 2.6%,支持調用其他 Gemini 模型完成圖像生成等複雜任務。

Gemini 3.5 Transcribe的主要功能
-
實時流式轉錄:通過 Live API 提供亞秒級延遲的連續雙向語音轉文本服務。
-
預錄音頻轉寫:通過 Interactions API 爲錄音文件提供帶說話人歸屬和詞級時間戳的精確轉錄。
-
智能文本清理:自動去除”嗯””啊”等填充詞,修正自我糾正語句,並輸出格式化文本。
-
自定義詞彙適配:根據用戶提供的專業術語和特殊拼寫調整轉錄結果,準確識別郵政編碼、訂單號等字母數字組合。
-
多語言自動檢測:支持 85 種以上語言的自動識別與轉錄,並能處理實時語言切換和多種口音方言。
-
多說話人區分:在預錄音頻中準確歸屬最多三位說話人的發言內容。
-
跨模型功能調用:在轉錄過程中可調用其他 Gemini 模型執行圖像生成、文件分析等複雜任務。
-
屏幕上下文融合:結合設備屏幕內容和對話歷史提升特定場景下的轉錄準確度。
Gemini 3.5 Transcribe的技術原理
- 端到端音頻理解:模型直接從原始音頻波形生成文本,避免中間表示引入的誤差累積,同時保留語音中的語調、停頓等副語言信息用於語義消歧。
- 原生多模態融合:基於 Gemini 3.5 統一架構,音頻與文本在共享的 Transformer 注意力空間中進行聯合編碼,使模型能建立聲學特徵與語義概唸的直接映射。
- 上下文感知推理:通過長上下文窗口同時處理語音信號、屏幕截圖文本和對話歷史,用交叉注意力機制動態加權相關上下文,提升專有名詞、文件名稱和領域術語的識別精度。
- 增量流式解碼:採用自適應分塊與投機解碼策略,在音頻輸入持續到達的同時進行局部語義整合,平衡低延遲需求與輸出穩定性,支持雙向交互中的即時響應與打斷處理。
如何使用Gemini 3.5 Transcribe
-
開發者接入:通過 Gemini API 在 Google AI Studio 或 Gemini Enterprise Agent Platform 調用模型。
-
實時語音交互:用 Live API 調用
gemini-3.5-transcribe-live實現雙向流式轉錄。 -
錄音文件處理:用 Interactions API 調用
gemini-3.5-transcribe進行帶時間戳的離線轉寫。 -
macOS 桌面端:在 Gemini macOS 應用中直接用語音輸入、編輯文本並調用其他模型功能。
-
Android 輸入法:在 Gboard 中開啓 Rambler 功能,語音輸入自動清理並支持語音改稿。
-
Chrome 瀏覽器:即將支持在任意網頁輸入框中語音輸入與打字。
-
企業部署:通過 Gemini Enterprise Agent Platform 集成至客服與內部工作流。
-
第三方框架:藉助 Agora、LiveKit、Vercel 等已接入 Live API 的平台快速搭建語音應用。
Gemini 3.5 Transcribe的核心優勢
-
轉錄精度領先:流式場景詞錯誤率低至 4.0%,非流式低至 2.6%,在嘈雜環境中仍能準確捕獲字母數字實體。
-
延遲大幅優化:相比前代 Chirp 3,最終轉錄交付時間縮短 70%,實時流式響應達到亞秒級。
-
智能語義清理:自動去除填充詞、修正自我糾正語句,並輸出可直接使用的格式化文本。
-
多語言無縫切換:自動識別並轉錄 85 種以上語言,支持對話中的實時語言切換與多方言口音適配。
-
說話人精準歸屬:預錄音頻支持最多三位說話人的發言區分,並附帶詞級時間戳便於回溯定位。
-
屏幕上下文感知:結合設備屏幕內容與對話歷史,顯著提升文件名稱、專業術語和活躍文檔的識別準確度。
-
跨模型任務協同:內置 Function Calling 能力,可在轉錄過程中調用其他 Gemini 模型完成圖像生成、文件分析等複雜操作。
Gemini 3.5 Transcribe的項目地址
- 項目官網:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Gemini 3.5 Transcribe的同類競品對比
| 對比維度 | Gemini 3.5 Transcribe | OpenAI GPT-4o-transcribe |
|---|---|---|
| 定位 | 智能語音轉錄模型,支持實時流式與預錄音頻 | GPT-4o 架構的專用轉錄模型,API 託管服務 |
| 詞錯誤率 WER | 流式 4.0% / 非流式 2.6% | 約 2.5%(乾淨音頻,行業領先) |
| 實時流式延遲 | 亞秒級,原生雙向連續流式 | 支持流式,通過 Realtime API 實現 |
| 智能文本清理 | 自動去除填充詞、修正自我糾正、格式化輸出 | 不支持,輸出原始口語化文本 |
| 說話人歸屬 | 原生支持最多 3 人區分 + 詞級時間戳 | 不支持原生,需額外調用 diarize 端點 |
Gemini 3.5 Transcribe的應用場景
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...