跳转到主要内容
Gemini 3.6 Flash(gemini-3.6-flash)是谷歌 2026 年 7 月更新的多模态文本模型(stable 版),支持文本/图像/视频/音频/PDF 输入,1M 上下文、64K 输出。API易已完成双端点全量实测(26+5 用例),Gemini 原生格式与 OpenAI 兼容格式均可直接调用,搜索 grounding、代码执行、URL context 等原生工具实测可用。
API易已接入 Gemini 3.6 Flash:模型名 gemini-3.6-flashdefault / svip 分组可用。默认开启深度思考(思考 tokens 计入输出计费),对延迟和成本敏感的场景请调低思考档位(详见下方「思考控制」)。轻量场景可考虑半价姊妹款 Gemini 3.5 Flash-Lite

核心优势

原生工具全家桶

Google 搜索 grounding、Maps grounding、URL context、代码执行、Computer Use(Preview)在原生端点全部实测放通,无需 Google API Key。

全模态理解

图像、PDF、音频实测识别准确(视频同管线支持),1M 上下文可塞整本书或整个代码库。

思考四档可控

thinkingLevel minimal/low/medium/high 实测思考量 0/403/487/837 tokens 单调递增,按任务精确控制思考成本。

双端点无缝接入

Gemini 原生格式(官方 SDK 直连)与 OpenAI 兼容格式(改 base_url 即用)同时开通,与官网同价。

模型信息

实测能力矩阵

以下为 API易 2026 年 7 月 22 日的实测结果(官方能力声明 vs 实际表现):
代码执行说明:实测代码在上游真实执行(不可心算的 sha256 题答案正确),但响应中 executableCode / codeExecutionResult 字段暂不回显,代码与运行结果会在正文文本中呈现。依赖这两个字段做界面分离展示的应用请注意。

定价

价格说明:思考 tokens 按输出计费——这是控制思考档位最直接的理由。API易与官网同价,折扣体现在充值加赠:充 $100 送 10%、最高送 20%(≈83 折),详见 充值优惠

思考控制

默认开启深度思考:一句 1+1 也会先产生约 200 思考 tokens。实测四档:
需要查看思考过程时传 thinkingConfig: {"includeThoughts": true},响应中会返回带 thought: true 标记的思考 part,用量看 usageMetadata.thoughtsTokenCount。OpenAI 兼容端用 reasoning_effort(low/medium/high)分档,消耗看 usage.completion_tokens_details.reasoning_tokens

调用示例

Gemini 原生格式(推荐,工具全支持)

OpenAI 兼容格式(存量代码零改造)

常见问题

不需要。API易令牌(sk- 开头)直接放在 x-goog-api-key 请求头即可,官方 google-genai SDK 只需把 base_url 改为 https://api.apiyi.com
不能。google_search、url_context、codeExecution、Maps grounding、Computer Use 等原生工具仅 Gemini 原生格式支持,OpenAI 兼容端覆盖常规能力(对话/流式/FC/JSON Schema/视觉)。
相同长前缀第二次请求可能命中(实测 15.9K tokens 前缀命中 8,176 tokens),但命中为概率行为,请勿按稳定命中做成本测算。显式缓存 API(cachedContents)平台暂未开通。
要工具、要深度思考、要更强推理选 3.6 Flash;高频、低延迟、成本敏感选 3.5 Flash-Lite(输入 $0.30/输出 $2.50,默认不思考、响应约快一倍)。

相关文档