Gemini 3.5 Transcribe – 谷歌推出的最新語音轉文本模型

AI工具9小時前發佈新公告 AI管理員
0 0

Gemini 3.5 Transcribe是什麼

Gemini 3.5 Transcribe 是 Google 推出的最新語音轉文本模型,支持實時流式和預錄音頻處理兩種模式,前者通過 Live API 實現亞秒級延遲,後者支持說話人歸屬與詞級時間戳。Gemini 3.5 Transcribe 能自動清理填充詞與自我糾正、識別 85 種以上語言及實時語言切換、自定義專業詞彙,詞錯誤率低至 2.6%,支持調用其他 Gemini 模型完成圖像生成等複雜任務。

Gemini 3.5 Transcribe – 谷歌推出的最新語音轉文本模型

Gemini 3.5 Transcribe的主要功能

  • 實時流式轉錄:通過 Live API 提供亞秒級延遲的連續雙向語音轉文本服務。
  • 預錄音頻轉寫:通過 Interactions API 爲錄音文件提供帶說話人歸屬和詞級時間戳的精確轉錄。
  • 智能文本清理:自動去除”嗯””啊”等填充詞,修正自我糾正語句,並輸出格式化文本。
  • 自定義詞彙適配:根據用戶提供的專業術語和特殊拼寫調整轉錄結果,準確識別郵政編碼、訂單號等字母數字組合。
  • 多語言自動檢測:支持 85 種以上語言的自動識別與轉錄,並能處理實時語言切換和多種口音方言。
  • 多說話人區分:在預錄音頻中準確歸屬最多三位說話人的發言內容。
  • 跨模型功能調用:在轉錄過程中可調用其他 Gemini 模型執行圖像生成、文件分析等複雜任務。
  • 屏幕上下文融合:結合設備屏幕內容和對話歷史提升特定場景下的轉錄準確度。

Gemini 3.5 Transcribe的技術原理

  • 端到端音頻理解:模型直接從原始音頻波形生成文本,避免中間表示引入的誤差累積,同時保留語音中的語調、停頓等副語言信息用於語義消歧。
  • 原生多模態融合:基於 Gemini 3.5 統一架構,音頻與文本在共享的 Transformer 注意力空間中進行聯合編碼,使模型能建立聲學特徵與語義概唸的直接映射。
  • 上下文感知推理:通過長上下文窗口同時處理語音信號、屏幕截圖文本和對話歷史,用交叉注意力機制動態加權相關上下文,提升專有名詞、文件名稱和領域術語的識別精度。
  • 增量流式解碼:採用自適應分塊與投機解碼策略,在音頻輸入持續到達的同時進行局部語義整合,平衡低延遲需求與輸出穩定性,支持雙向交互中的即時響應與打斷處理。

如何使用Gemini 3.5 Transcribe

  • 開發者接入:通過 Gemini API 在 Google AI Studio 或 Gemini Enterprise Agent Platform 調用模型。
  • 實時語音交互:用 Live API 調用 gemini-3.5-transcribe-live 實現雙向流式轉錄。
  • 錄音文件處理:用 Interactions API 調用 gemini-3.5-transcribe 進行帶時間戳的離線轉寫。
  • macOS 桌面端:在 Gemini macOS 應用中直接用語音輸入、編輯文本並調用其他模型功能。
  • Android 輸入法:在 Gboard 中開啓 Rambler 功能,語音輸入自動清理並支持語音改稿。
  • Chrome 瀏覽器:即將支持在任意網頁輸入框中語音輸入與打字。
  • 企業部署:通過 Gemini Enterprise Agent Platform 集成至客服與內部工作流。
  • 第三方框架:藉助 Agora、LiveKit、Vercel 等已接入 Live API 的平台快速搭建語音應用。

Gemini 3.5 Transcribe的核心優勢

  • 轉錄精度領先:流式場景詞錯誤率低至 4.0%,非流式低至 2.6%,在嘈雜環境中仍能準確捕獲字母數字實體。
  • 延遲大幅優化:相比前代 Chirp 3,最終轉錄交付時間縮短 70%,實時流式響應達到亞秒級。
  • 智能語義清理:自動去除填充詞、修正自我糾正語句,並輸出可直接使用的格式化文本。
  • 多語言無縫切換:自動識別並轉錄 85 種以上語言,支持對話中的實時語言切換與多方言口音適配。
  • 說話人精準歸屬:預錄音頻支持最多三位說話人的發言區分,並附帶詞級時間戳便於回溯定位。
  • 屏幕上下文感知:結合設備屏幕內容與對話歷史,顯著提升文件名稱、專業術語和活躍文檔的識別準確度。
  • 跨模型任務協同:內置 Function Calling 能力,可在轉錄過程中調用其他 Gemini 模型完成圖像生成、文件分析等複雜操作。

Gemini 3.5 Transcribe的項目地址

  • 項目官網:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

Gemini 3.5 Transcribe的同類競品對比

對比維度 Gemini 3.5 Transcribe OpenAI GPT-4o-transcribe
定位 智能語音轉錄模型,支持實時流式與預錄音頻 GPT-4o 架構的專用轉錄模型,API 託管服務
詞錯誤率 WER 流式 4.0% / 非流式 2.6% 約 2.5%(乾淨音頻,行業領先)
實時流式延遲 亞秒級,原生雙向連續流式 支持流式,通過 Realtime API 實現
智能文本清理 自動去除填充詞、修正自我糾正、格式化輸出 不支持,輸出原始口語化文本
說話人歸屬 原生支持最多 3 人區分 + 詞級時間戳 不支持原生,需額外調用 diarize 端點

Gemini 3.5 Transcribe的應用場景

  • 實時會議智能紀要:在多人會議中實時流式轉錄,自動區分說話人、清理口語填充詞,調用 Gemini 模型即時生成會議摘要與待辦事項。
  • 多語言客服語音助手:通過 Live API 構建亞秒級延遲的語音客服系統,自動識別客戶語言並實時切換,結合自定義詞彙準確識別訂單號、產品型號等關鍵信息。
  • 醫療與法律口述記錄:醫生或律師通過語音口述病歷、庭審記錄,模型自動清理自我糾正語句並格式化專業術語,輸出可直接歸檔的標準文檔。
  • 跨語言實時字幕與翻譯:爲直播、視頻會議提供多語言實時字幕,用 85+ 語言自動檢測能力,結合實時語言切換實現無縫跨語言溝通。
  • 語音驅動編程與辦公自動化:在 Google AI Studio 或 Gemini macOS 應用中,開發者通過語音描述需求即可生成代碼,辦公人員語音指令調用屏幕上下文完成跨應用文件總結與圖像生成。
© 版權聲明

相關文章

暫無評論

暫無評論...