Gemini 3.5 Flash-Lite是什麼
Gemini 3.5 Flash-Lite 是 Google 推出的最快、最便宜的 Gemini 3.5 系列模型,專爲高吞吐、低延遲的生產級 Agent 工作流設計。模型支持可調推理檔位,輸出速度達 350 token/s,定價僅 $0.30/$2.50 每百萬 token,在多項 Agent 與代碼基準上反超前代 3 Flash,適合批量文檔處理、子 Agent 協作與實時交互場景。

Gemini 3.5 Flash-Lite的主要功能
-
極速輸出:3.5 系列中最快,Artificial Analysis 實測達 350 輸出 token/秒。
-
可調推理檔位:支持低/中/高多檔思考模式,簡單任務開最低檔保速度,複雜子任務調高檔保質量。
-
內置計算機操作:Computer Use 成爲內置工具,開箱即用支持 Agent 任務。
-
質量越級提升:相比 3.1 Flash-Lite,代碼、長上下文與真實任務執行能力大幅躍升。
Gemini 3.5 Flash-Lite的技術原理
-
架構基礎:基於 Gemini 3.5 Flash 架構精簡優化,保留核心能力同時極致壓縮推理開銷。
-
動態思考模式:通過可配置的思考深度(thinking levels),在延遲與質量間按需切換。
-
高吞吐優化:針對批量文檔處理、Agent 搜索等場景優化並行生成效率,實現 350 token/s 的峯值輸出。
如何使用Gemini 3.5 Flash-Lite
-
開發者:通過 Google AI Studio、Gemini API 調用,支持靈活配置思考檔位。
-
企業用戶:集成於 Gemini Enterprise Agent Platform,適合高併發生產流量。
-
普通用戶:已逐步 rollout 至 Google Search 等消費端場景。
Gemini 3.5 Flash-Lite的核心優勢
-
速度成本雙極致:350 token/s 的生成速度配合 $0.3/$2.5 的定價,大規模任務成本極低。
-
以小博大:在 SWE-Bench Pro和 OSWorld-Verified(74.0% vs 65.1%)上反超輩分更高的 3 Flash。
-
彈性思考檔位:開發者可按任務複雜度自由切換推理深度,無需爲簡單任務支付不必要的計算開銷。
-
Agent 原生:內置 Computer Use 與多檔思考模式,專爲子 Agent 協作、批量數據處理等場景設計。
Gemini 3.5 Flash-Lite的同類競品對比
| 對比維度 | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 54.0% | 31.0% |
| GDPval-AA v2 | 1140 | 642 |
| GDM-MRCR v2 | 72.2% | 60.1% |
| 輸出速度 | 350 token/s | 未公開 |
| 輸入價格 | $0.30/百萬 token | 更高 |
| 輸出價格 | $2.50/百萬 token | 更高 |
Gemini 3.5 Flash-Lite的應用場景
-
高吞吐 Agent 搜索:大規模網頁檢索、信息聚合與摘要生成,低延遲響應用戶查詢。
-
批量文檔處理: Receipt 翻譯、電商產品特徵提取、合同批量解析等海量數據流水線。
-
子 Agent 協作:作爲主 Agent(如 3.6 Flash)的副手,快速生成多版本方案(如 25 個網頁設計概念)供篩選。
-
實時交互應用:客服機器人、實時推薦系統、低延遲對話接口等需要快速響應的場景。
-
輕量級遊戲/創意生成:快速迭代生成小遊戲原型、視覺素材,配合人類反饋即時調優。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...