gemini-3.5-flash-lite)是谷歌 2026 年 7 月更新的轻量多模态模型(stable 版),主打高频、低延迟、低成本,支持文本/图像/视频/音频/PDF 输入,1M 上下文、64K 输出。API易已完成双端点全量实测(25+5 用例),Gemini 原生格式与 OpenAI 兼容格式均可直接调用,搜索 grounding、URL context 等原生工具实测可用。
API易已接入 Gemini 3.5 Flash-Lite:模型名
gemini-3.5-flash-lite,default / svip 分组可用。与 3.6 Flash 相反——默认不输出思考,简单请求实测约 2 秒返回;需要深度推理时传 thinkingLevel: "high" 显式开启。核心优势
极致性价比
输入 $0.30、输出 $2.50 每 1M tokens(音频输入同价),仅为 3.6 Flash 的 1/5–1/3,适合高频调用与批量处理。
默认零思考低延迟
默认不产生思考 tokens,简单请求实测约 2 秒返回(3.6 Flash 约 4.5 秒),客服、分类、抽取等场景开箱即用。
全模态理解
图像、PDF、音频实测识别准确(视频同管线支持),1M 上下文与旗舰同规格。
原生工具可用
Google 搜索 grounding、Maps grounding、URL context、代码执行在原生端点实测放通,无需 Google API Key。
模型信息
实测能力矩阵
以下为 API易 2026 年 7 月 22 日的实测结果(官方能力声明 vs 实际表现):定价
价格说明:API易与官网同价,折扣体现在充值加赠:充 $100 送 10%、最高送 20%(≈83 折),详见 充值优惠。
思考控制
与 3.6 Flash 相反,本模型默认不思考——这正是它快和便宜的原因。实测:调用示例
Gemini 原生格式(推荐,工具全支持)
OpenAI 兼容格式(存量代码零改造)
常见问题
什么场景选 Flash-Lite 而不是 3.6 Flash?
什么场景选 Flash-Lite 而不是 3.6 Flash?
高频短问答、分类、抽取、翻译、客服等吞吐优先的场景选 Flash-Lite(快约一倍、便宜至 1/5);需要深度推理、复杂规划或 Computer Use 时选 3.6 Flash。
原生端点需要 Google API Key 吗?
原生端点需要 Google API Key 吗?
不需要。API易令牌(
sk- 开头)直接放在 x-goog-api-key 请求头即可,官方 google-genai SDK 只需把 base_url 改为 https://api.apiyi.com。怎么观测思考消耗?
怎么观测思考消耗?
原生端点看
usageMetadata.thoughtsTokenCount。注意 OpenAI 兼容端本模型不回显 reasoning_tokens,需要精确观测思考消耗请用原生端点。隐式缓存能命中吗?
隐式缓存能命中吗?
实测 15.9K tokens 相同前缀连打 3 次未观测到命中(同条件 3.6 Flash 命中 1 次),请勿按缓存命中做成本测算。显式缓存 API 平台暂未开通。