Skip to main content
Gemini 3.5 Flash-Lite(gemini-3.5-flash-lite)是谷歌 2026 年 7 月更新的輕量多模態模型(stable 版),主打高頻、低延遲、低成本,支援文本/影像/影片/音訊/PDF 輸入,1M 上下文、64K 輸出。API易已完成雙端點全量實測(25+5 用例),Gemini 原生格式與 OpenAI 相容格式均可直接呼叫,搜尋 grounding、URL context 等原生工具實測可用。
API易已接入 Gemini 3.5 Flash-Lite:模型名 gemini-3.5-flash-litedefault / svip 分組可用。與 3.6 Flash 相反——預設不輸出思考,簡單請求實測約 2 秒返回;需要深度推理時傳 thinkingLevel: "high" 顯式開啟。

核心優勢

極致價效比

輸入 $0.30、輸出 $2.50 每 1M tokens(音訊輸入同價),僅為 3.6 Flash 的 1/5–1/3,適合高頻呼叫與批次處理。

預設零思考低延遲

預設不產生思考 tokens,簡單請求實測約 2 秒返回(3.6 Flash 約 4.5 秒),客服、分類、抽取等場景開箱即用。

全模態理解

影像、PDF、音訊實測識別準確(影片同管線支援),1M 上下文與旗艦同規格。

原生工具可用

Google 搜尋 grounding、Maps grounding、URL context、程式碼執行在原生端點實測放通,無需 Google API Key。

模型資訊

實測能力矩陣

以下為 API易 2026 年 7 月 22 日的實測結果(官方能力宣告 vs 實際表現):

定價

價格說明:API易與官網同價,折扣體現在充值加贈:充 $100 送 10%、最高送 20%(≈83 折),詳見 充值優惠

思考控制

與 3.6 Flash 相反,本模型預設不思考——這正是它快和便宜的原因。實測:
實用建議:要思考就直接上 high,中間檔位對簡單問題不產生思考;配合 includeThoughts: true 可回顯思考過程。若任務長期需要深度推理,直接選 Gemini 3.6 Flash 更合適。

呼叫示例

Gemini 原生格式(推薦,工具全支援)

OpenAI 相容格式(存量程式碼零改造)

常見問題

高頻短問答、分類、抽取、翻譯、客服等吞吐優先的場景選 Flash-Lite(快約一倍、便宜至 1/5);需要深度推理、複雜規劃或 Computer Use 時選 3.6 Flash
不需要。API易令牌(sk- 開頭)直接放在 x-goog-api-key 請求頭即可,官方 google-genai SDK 只需把 base_url 改為 https://api.apiyi.com
原生端點看 usageMetadata.thoughtsTokenCount。注意 OpenAI 相容端本模型不回顯 reasoning_tokens,需要精確觀測思考消耗請用原生端點。
實測 15.9K tokens 相同字首連打 3 次未觀測到命中(同條件 3.6 Flash 命中 1 次),請勿按快取命中做成本測算。顯式快取 API 平臺暫未開通。

相關文件