Skip to main content
Gemini 3.8 Flash(gemini-3.8-flash)是谷歌 2026 年 9 月 2 日推出的多模态文本模型,支持文本 / 图像 / 视频 / 音频输入。API易 已开通 Gemini 原生OpenAI 兼容双端点,并在上线前完成 150 例双协议成对实测(以 gemini-3.7-flash 为参照)。
API易 已接入 Gemini 3.8 Flash:模型名 gemini-3.8-flashdefault / svip 分组可用。默认开启深度思考(思考 tokens 计入输出计费),对延迟和成本敏感的场景请调低思考档位或关闭思考(详见下方「思考控制」)。
官方规格尚未公布:截至本页发布,谷歌的 Gemini API 模型列表与 DeepMind 模型卡都还没有收录 3.8 Flash,官方发布博客也未上线。因此上下文窗口、最大输出、知识截止、官方基准分数本页一律标注”官方未公布”,不做转述也不做推测。本页所有”实测”标记的内容均来自 API易 自己的测试,官方材料发布后会同步补齐。

核心优势

比 3.6 Flash 便宜一半

输入 $0.75 / 输出 $3.75 每 1M tokens,是 3.6 Flash($1.50 / $7.50)的一半;与 3.7 Flash 逐项同价,从 3.7 平迁零成本变化。

上线前 150 例实测

与 3.7 Flash 成对同时发起、双协议覆盖,核心能力、推理、并行工具调用、图片视频理解逐项对齐,未发现 3.8 独有回退。

双端点无缝接入

Gemini 原生格式(官方 SDK 直连,无需 Google API Key)与 OpenAI 兼容格式(改 base_url 即用)同时开通。

迁移成本接近于零

从 3.7 Flash 只改模型名:请求结构、参数、返回字段均不变,实测响应字段集差异仅 1 组且无字段类型变化。

模型信息

实测能力矩阵

以下为 API易 2026 年 9 月 2 日的实测结果,共 150 份用例日志、198 次调用,每个用例与 gemini-3.7-flash 同时发起以排除时段干扰:
搜索 grounding 待确认:传入 tools: [{"googleSearch": {}}] 时请求返回 200 且答案正确,但响应中没有 groundingMetadata,说明该答案来自模型自身知识而非实时检索。gemini-3.7-flash 在同一轮测试中表现完全相同,因此这更可能是链路层面的开通状态、而非模型能力差异。依赖实时检索的场景请先小流量验证,不要按”已 grounding”设计。

定价

gemini-3.7-flash 逐项一致,从 3.7 平迁不涉及任何成本变化;相比 3.6 Flash($1.50 / $7.50)则直接减半
价格说明:思考 tokens 按输出计费——这是控制思考档位最直接的理由。谷歌尚未公布 3.8 Flash 的官方定价;作为参考,3.7 Flash 现行的 $0.75 / $3.75 是谷歌自己的限时优惠价,官方注明有效期至 2026 年 12 月 31 日。API易 的模型价格与原厂逐项对齐,折扣通过充值加赠体现,详见 充值优惠

思考控制

默认开启深度思考:一句 1+1 也会先产生上百思考 tokens。实测三档(同一道题、原生端点):
minimal 档已被移除(3.6 Flash 有、3.8 没有):原生端点传 thinkingLevel: "minimal" 会直接返回 400 Thinking level is unsupported: THINKING_LEVEL_MINIMAL。要完全关闭思考请改用 thinkingConfig: {"thinkingBudget": 0}更需要注意 OpenAI 兼容端:传 reasoning_effort: "minimal" 不会报错,返回 200,但实测仍消耗了 76 个思考 token 并计入输出计费——即参数被静默忽略、思考照常发生。从 3.6 Flash 迁移过来的代码若还带着 minimal,在这一端不会有任何报错提示你改。
需要查看思考过程时传 thinkingConfig: {"includeThoughts": true},响应中会返回带 thought: true 标记的思考 part,用量看 usageMetadata.thoughtsTokenCount。OpenAI 兼容端用 reasoning_effort(low / medium / high)分档,消耗看 usage.completion_tokens_details.reasoning_tokens

调用示例

Gemini 原生格式(推荐,工具支持更全)

OpenAI 兼容格式(存量代码零改造)

迁移指南

只改模型名。实测请求结构、参数与返回字段均无变化,响应字段集差异仅 1 组且无类型变化,客户端不需要适配。价格逐项相同,用量预算可直接沿用。
价格直接减半(输入 $1.50 → $0.75、输出 $7.50 → $3.75),但有一处必改:thinkingLevel: "minimal" 已不支持,原生端点会返回 400,需改成 thinkingConfig: {"thinkingBudget": 0}。OpenAI 兼容端的 reasoning_effort: "minimal" 不报错但会被静默忽略、思考照常计费,务必一并改掉。
官方未公布,我们也不按 3.7 的数字推测。实测 14.5K 字符前缀的长上下文定位任务正常通过。长上下文重度依赖的场景建议先小流量灰度,确认边界后再全量切换;官方规格公布后本页会补齐。
不需要。API易 令牌(sk- 开头)直接放在 x-goog-api-key 请求头即可,官方 google-genai SDK 只需把 base_url 改为 https://api.apiyi.com
代码执行、URL context、safetySettingsstopSequencesseed 的严格执行都只在 Gemini 原生端点可用。OpenAI 兼容端覆盖常规能力(对话 / 流式 / Function Call / JSON Schema / 视觉),但 stopseed 实测不生效。

相关文档