gemini-3.6-flash)是谷歌 2026 年 7 月更新的多模态文本模型(stable 版),支持文本/图像/视频/音频/PDF 输入,1M 上下文、64K 输出。API易已完成双端点全量实测(26+5 用例),Gemini 原生格式与 OpenAI 兼容格式均可直接调用,搜索 grounding、代码执行、URL context 等原生工具实测可用。
API易已接入 Gemini 3.6 Flash:模型名
gemini-3.6-flash,default / svip 分组可用。默认开启深度思考(思考 tokens 计入输出计费),对延迟和成本敏感的场景请调低思考档位(详见下方「思考控制」)。轻量场景可考虑半价姊妹款 Gemini 3.5 Flash-Lite。核心优势
原生工具全家桶
Google 搜索 grounding、Maps grounding、URL context、代码执行、Computer Use(Preview)在原生端点全部实测放通,无需 Google API Key。
全模态理解
图像、PDF、音频实测识别准确(视频同管线支持),1M 上下文可塞整本书或整个代码库。
思考四档可控
thinkingLevel minimal/low/medium/high 实测思考量 0/403/487/837 tokens 单调递增,按任务精确控制思考成本。
双端点无缝接入
Gemini 原生格式(官方 SDK 直连)与 OpenAI 兼容格式(改 base_url 即用)同时开通,与官网同价。
模型信息
实测能力矩阵
以下为 API易 2026 年 7 月 22 日的实测结果(官方能力声明 vs 实际表现):定价
价格说明:思考 tokens 按输出计费——这是控制思考档位最直接的理由。API易与官网同价,折扣体现在充值加赠:充 $100 送 10%、最高送 20%(≈83 折),详见 充值优惠。
思考控制
默认开启深度思考:一句 1+1 也会先产生约 200 思考 tokens。实测四档:调用示例
Gemini 原生格式(推荐,工具全支持)
OpenAI 兼容格式(存量代码零改造)
常见问题
原生端点需要 Google API Key 吗?
原生端点需要 Google API Key 吗?
不需要。API易令牌(
sk- 开头)直接放在 x-goog-api-key 请求头即可,官方 google-genai SDK 只需把 base_url 改为 https://api.apiyi.com。搜索 grounding / 代码执行在 OpenAI 兼容端能用吗?
搜索 grounding / 代码执行在 OpenAI 兼容端能用吗?
不能。google_search、url_context、codeExecution、Maps grounding、Computer Use 等原生工具仅 Gemini 原生格式支持,OpenAI 兼容端覆盖常规能力(对话/流式/FC/JSON Schema/视觉)。
隐式缓存能省多少?
隐式缓存能省多少?
相同长前缀第二次请求可能命中(实测 15.9K tokens 前缀命中 8,176 tokens),但命中为概率行为,请勿按稳定命中做成本测算。显式缓存 API(cachedContents)平台暂未开通。
和 Gemini 3.5 Flash-Lite 怎么选?
和 Gemini 3.5 Flash-Lite 怎么选?
要工具、要深度思考、要更强推理选 3.6 Flash;高频、低延迟、成本敏感选 3.5 Flash-Lite(输入 $0.30/输出 $2.50,默认不思考、响应约快一倍)。