Gemini 3.5 Flash-Lite – 谷歌推出的輕量版 AI 模型

AI工具3天前發佈新公告 AI管理員
0 0

Gemini 3.5 Flash-Lite是什麼

Gemini 3.5 Flash-Lite 是 Google 推出的最快、最便宜的 Gemini 3.5 系列模型,專爲高吞吐、低延遲的生產級 Agent 工作流設計。模型支持可調推理檔位,輸出速度達 350 token/s,定價僅 $0.30/$2.50 每百萬 token,在多項 Agent 與代碼基準上反超前代 3 Flash,適合批量文檔處理、子 Agent 協作與實時交互場景。

Gemini 3.5 Flash-Lite – 谷歌推出的輕量版 AI 模型

Gemini 3.5 Flash-Lite的主要功能

  • 極速輸出:3.5 系列中最快,Artificial Analysis 實測達 350 輸出 token/秒。
  • 可調推理檔位:支持低/中/高多檔思考模式,簡單任務開最低檔保速度,複雜子任務調高檔保質量。
  • 內置計算機操作:Computer Use 成爲內置工具,開箱即用支持 Agent 任務。
  • 質量越級提升:相比 3.1 Flash-Lite,代碼、長上下文與真實任務執行能力大幅躍升。

Gemini 3.5 Flash-Lite的技術原理

  • 架構基礎:基於 Gemini 3.5 Flash 架構精簡優化,保留核心能力同時極致壓縮推理開銷。
  • 動態思考模式:通過可配置的思考深度(thinking levels),在延遲與質量間按需切換。
  • 高吞吐優化:針對批量文檔處理、Agent 搜索等場景優化並行生成效率,實現 350 token/s 的峯值輸出。

如何使用Gemini 3.5 Flash-Lite

  • 開發者:通過 Google AI Studio、Gemini API 調用,支持靈活配置思考檔位。
  • 企業用戶:集成於 Gemini Enterprise Agent Platform,適合高併發生產流量。
  • 普通用戶:已逐步 rollout 至 Google Search 等消費端場景。

Gemini 3.5 Flash-Lite的核心優勢

  • 速度成本雙極致:350 token/s 的生成速度配合 $0.3/$2.5 的定價,大規模任務成本極低。
  • 以小博大:在 SWE-Bench Pro和 OSWorld-Verified(74.0% vs 65.1%)上反超輩分更高的 3 Flash。
  • 彈性思考檔位:開發者可按任務複雜度自由切換推理深度,無需爲簡單任務支付不必要的計算開銷。
  • Agent 原生:內置 Computer Use 與多檔思考模式,專爲子 Agent 協作、批量數據處理等場景設計。

Gemini 3.5 Flash-Lite的同類競品對比

對比維度 Gemini 3.5 Flash-Lite Gemini 3.1 Flash-Lite
Terminal-Bench 2.1 54.0% 31.0%
GDPval-AA v2 1140 642
GDM-MRCR v2 72.2% 60.1%
輸出速度 350 token/s 未公開
輸入價格 $0.30/百萬 token 更高
輸出價格 $2.50/百萬 token 更高

Gemini 3.5 Flash-Lite的應用場景

  • 高吞吐 Agent 搜索:大規模網頁檢索、信息聚合與摘要生成,低延遲響應用戶查詢。
  • 批量文檔處理: Receipt 翻譯、電商產品特徵提取、合同批量解析等海量數據流水線。
  • 子 Agent 協作:作爲主 Agent(如 3.6 Flash)的副手,快速生成多版本方案(如 25 個網頁設計概念)供篩選。
  • 實時交互應用:客服機器人、實時推薦系統、低延遲對話接口等需要快速響應的場景。
  • 輕量級遊戲/創意生成:快速迭代生成小遊戲原型、視覺素材,配合人類反饋即時調優。
© 版權聲明

相關文章

暫無評論

暫無評論...