跳转到主要内容
Gemini 3.5 Flash-Lite(gemini-3.5-flash-lite)是谷歌 2026 年 7 月更新的轻量多模态模型(stable 版),主打高频、低延迟、低成本,支持文本/图像/视频/音频/PDF 输入,1M 上下文、64K 输出。API易已完成双端点全量实测(25+5 用例),Gemini 原生格式与 OpenAI 兼容格式均可直接调用,搜索 grounding、URL context 等原生工具实测可用。
API易已接入 Gemini 3.5 Flash-Lite:模型名 gemini-3.5-flash-litedefault / svip 分组可用。与 3.6 Flash 相反——默认不输出思考,简单请求实测约 2 秒返回;需要深度推理时传 thinkingLevel: "high" 显式开启。

核心优势

极致性价比

输入 $0.30、输出 $2.50 每 1M tokens(音频输入同价),仅为 3.6 Flash 的 1/5–1/3,适合高频调用与批量处理。

默认零思考低延迟

默认不产生思考 tokens,简单请求实测约 2 秒返回(3.6 Flash 约 4.5 秒),客服、分类、抽取等场景开箱即用。

全模态理解

图像、PDF、音频实测识别准确(视频同管线支持),1M 上下文与旗舰同规格。

原生工具可用

Google 搜索 grounding、Maps grounding、URL context、代码执行在原生端点实测放通,无需 Google API Key。

模型信息

实测能力矩阵

以下为 API易 2026 年 7 月 22 日的实测结果(官方能力声明 vs 实际表现):

定价

价格说明:API易与官网同价,折扣体现在充值加赠:充 $100 送 10%、最高送 20%(≈83 折),详见 充值优惠

思考控制

与 3.6 Flash 相反,本模型默认不思考——这正是它快和便宜的原因。实测:
实用建议:要思考就直接上 high,中间档位对简单问题不产生思考;配合 includeThoughts: true 可回显思考过程。若任务长期需要深度推理,直接选 Gemini 3.6 Flash 更合适。

调用示例

Gemini 原生格式(推荐,工具全支持)

OpenAI 兼容格式(存量代码零改造)

常见问题

高频短问答、分类、抽取、翻译、客服等吞吐优先的场景选 Flash-Lite(快约一倍、便宜至 1/5);需要深度推理、复杂规划或 Computer Use 时选 3.6 Flash
不需要。API易令牌(sk- 开头)直接放在 x-goog-api-key 请求头即可,官方 google-genai SDK 只需把 base_url 改为 https://api.apiyi.com
原生端点看 usageMetadata.thoughtsTokenCount。注意 OpenAI 兼容端本模型不回显 reasoning_tokens,需要精确观测思考消耗请用原生端点。
实测 15.9K tokens 相同前缀连打 3 次未观测到命中(同条件 3.6 Flash 命中 1 次),请勿按缓存命中做成本测算。显式缓存 API 平台暂未开通。

相关文档