gemini-3.5-flash-lite)是谷歌 2026 年 7 月更新的輕量多模態模型(stable 版),主打高頻、低延遲、低成本,支援文本/影像/影片/音訊/PDF 輸入,1M 上下文、64K 輸出。API易已完成雙端點全量實測(25+5 用例),Gemini 原生格式與 OpenAI 相容格式均可直接呼叫,搜尋 grounding、URL context 等原生工具實測可用。
API易已接入 Gemini 3.5 Flash-Lite:模型名
gemini-3.5-flash-lite,default / svip 分組可用。與 3.6 Flash 相反——預設不輸出思考,簡單請求實測約 2 秒返回;需要深度推理時傳 thinkingLevel: "high" 顯式開啟。核心優勢
極致價效比
輸入 $0.30、輸出 $2.50 每 1M tokens(音訊輸入同價),僅為 3.6 Flash 的 1/5–1/3,適合高頻呼叫與批次處理。
預設零思考低延遲
預設不產生思考 tokens,簡單請求實測約 2 秒返回(3.6 Flash 約 4.5 秒),客服、分類、抽取等場景開箱即用。
全模態理解
影像、PDF、音訊實測識別準確(影片同管線支援),1M 上下文與旗艦同規格。
原生工具可用
Google 搜尋 grounding、Maps grounding、URL context、程式碼執行在原生端點實測放通,無需 Google API Key。
模型資訊
實測能力矩陣
以下為 API易 2026 年 7 月 22 日的實測結果(官方能力宣告 vs 實際表現):定價
價格說明:API易與官網同價,折扣體現在充值加贈:充 $100 送 10%、最高送 20%(≈83 折),詳見 充值優惠。
思考控制
與 3.6 Flash 相反,本模型預設不思考——這正是它快和便宜的原因。實測:呼叫示例
Gemini 原生格式(推薦,工具全支援)
OpenAI 相容格式(存量程式碼零改造)
常見問題
什麼場景選 Flash-Lite 而不是 3.6 Flash?
什麼場景選 Flash-Lite 而不是 3.6 Flash?
高頻短問答、分類、抽取、翻譯、客服等吞吐優先的場景選 Flash-Lite(快約一倍、便宜至 1/5);需要深度推理、複雜規劃或 Computer Use 時選 3.6 Flash。
原生端點需要 Google API Key 嗎?
原生端點需要 Google API Key 嗎?
不需要。API易令牌(
sk- 開頭)直接放在 x-goog-api-key 請求頭即可,官方 google-genai SDK 只需把 base_url 改為 https://api.apiyi.com。怎麼觀測思考消耗?
怎麼觀測思考消耗?
原生端點看
usageMetadata.thoughtsTokenCount。注意 OpenAI 相容端本模型不回顯 reasoning_tokens,需要精確觀測思考消耗請用原生端點。隱式快取能命中嗎?
隱式快取能命中嗎?
實測 15.9K tokens 相同字首連打 3 次未觀測到命中(同條件 3.6 Flash 命中 1 次),請勿按快取命中做成本測算。顯式快取 API 平臺暫未開通。