> ## Documentation Index
> Fetch the complete documentation index at: https://docs.apiyi.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Gemini 3.8 Flash 上线：API 率先开放调用

> 谷歌 2026 年 9 月 2 日推出的 gemini-3.8-flash 已在 API易 开放调用，官方文档尚未收录，我们完成 150 例上线前实测：能力与 3.7 Flash 逐项一致，定价同为 $0.75/$3.75。

## 核心要点

* **API 率先上线**：谷歌于 2026 年 9 月 2 日推出 `gemini-3.8-flash`，距上一版 3.7 Flash 仅约三周。**谷歌官方模型文档与发布博客目前尚未收录这一版**，API易 已开放调用
* **定价与 3.7 Flash 完全一致**：输入 \$0.75 / 输出 \$3.75（每 1M tokens），缓存读取 \$0.0750，**从 3.7 平迁不涉及任何成本变化**
* **上线前完成 150 例实测**：与 `gemini-3.7-flash` 双协议成对对比，核心能力、推理、工具调用、多模态四段逐项对齐，**未发现 3.8 独有的能力回退**
* **双端点、双分组**：OpenAI 兼容格式与 Gemini 原生格式均可用，`default` / `svip` 两个分组均已开放
* **官方指标待公布**：第三方报道称本版主攻编码与 Agent、并显著减少冗长输出，但**官方基准数据与技术规格尚未发布**，本文不做转述

## 背景介绍

Flash 是 Gemini 系列的**中间档主力**——上有 Pro 顶配、下有 Flash-Lite 轻量款，Flash 承担"能力够用、单价能长期跑量"的绝大多数生产场景。

这条线的迭代节奏在过去两个月快得罕见：3.6 Flash 于 7 月 21 日发布，3.7 Flash 于 8 月 13 日跟上，3.8 Flash 又在 9 月 2 日到来——**五周三个版本**。

与前两次不同的是，这一版**跑在了官方文档前面**：截至本文发布，谷歌的 Gemini API 模型列表页与 DeepMind 模型卡都还没有 3.8 Flash 的条目，官方发布博客也未上线。第三方科技媒体报道称该模型内部代号 `skimaki`，已在 Google Cloud 的 Agent Studio 中可用，重点改进方向是编码、Agent 任务，以及减少此前 Flash 系列被反复吐槽的输出冗长问题。

<Warning>
  上述改进方向来自第三方媒体报道，**不是谷歌官方口径**。官方基准分数、上下文窗口、知识截止日期等规格目前均未公布，我们不做转述也不做推测。官方材料发布后本文会同步更新。
</Warning>

## 详细解析

### 上线前实测

正因为官方规格尚未公布，我们把重心放在了自己能验证的部分：以 `gemini-3.7-flash` 为参照，做了一轮成对对比测试——每个用例两个模型**同时发起**，落在同一时间窗内，避免把时段性波动误读成模型差异。

规模是 **150 份用例日志、198 次 HTTP 调用**，覆盖 Gemini 原生与 OpenAI 兼容两种协议。

| 测试维度            | gemini-3.8-flash | gemini-3.7-flash |
| --------------- | ---------------- | ---------------- |
| 核心能力（原生格式）      | 14/14            | 14/14            |
| 核心能力（OpenAI 兼容） | 12/13            | 12/13            |
| 推理题目（五类 × 2 轮）  | 10/10            | 10/10            |
| 并行工具调用          | 4/4              | 4/4              |
| 图片理解            | 2/2              | 2/2              |
| 视频理解            | 2/2              | 2/2              |
| 响应字段集差异         | 共 1 组，0 处字段类型变化  | —                |

逐项说明几个关键点：

* **函数调用闭环完整**：单次调用、结果回传、并行调用、顺序调用四种形态全部走通，并行调用在两轮复测中稳定返回两个调用、参数与 ID 完整
* **长上下文可用**：14,543 字符前缀 + 128 输出上限的定位题，两个模型给出同一个正确答案
* **结构化输出逐字节相同**：同一份 JSON Schema，两个模型返回的 JSON 完全一致
* **多模态计量一致**：同一张图、同一段视频，IMAGE 与 VIDEO 模态的 token 计数与 3.7 Flash 逐位相同
* **思考档位可用**：`low` / `medium` / `high` 三档均被接受，思考 token 呈梯度

唯一未满分的一格（OpenAI 兼容 12/13）是一个负向探针——传入非法思考档位时期望返回 4xx，实际返回 200。**`gemini-3.7-flash` 在同一个用例上表现完全相同**，属于既有行为，不是 3.8 的回退。

### 技术规格

| 项目           | 参数                                                                |
| ------------ | ----------------------------------------------------------------- |
| 模型 ID        | `gemini-3.8-flash`                                                |
| 输入模态         | 文本 / 图像 / 音频 / 视频（实测图像、视频可用）                                      |
| 输出模态         | 文本                                                                |
| 思考档位         | low / medium / high                                               |
| 支持端点         | `/v1/chat/completions`（OpenAI 兼容）、`/v1beta/models/...`（Gemini 原生） |
| 可用分组         | `default` / `svip`                                                |
| 上下文窗口 / 最大输出 | 官方未公布                                                             |
| 知识截止         | 官方未公布                                                             |

## 实际应用

### 推荐场景

* **从 3.7 Flash 平迁**：同价、同协议、同参数结构，改一处模型名即可，这是本次上线最直接的用法
* **编码与代码审查**：Flash 线连续三版的主攻方向，第三方报道称本版继续加强
* **Agent 与多步骤工作流**：并行工具调用实测稳定，适合需要一次拿到多个调用的编排场景
* **长文档与多模态批处理**：图像、视频理解实测可用，计量口径与 3.7 一致，成本可直接沿用旧模型的估算

### 代码示例

<CodeGroup>
  ```python OpenAI 兼容格式 theme={null}
  from openai import OpenAI

  client = OpenAI(api_key="YOUR_API_KEY", base_url="https://api.apiyi.com/v1")

  response = client.chat.completions.create(
      model="gemini-3.8-flash",
      messages=[
          {"role": "user", "content": "用 Python 写一个带重试和指数退避的 HTTP 客户端"}
      ]
  )
  print(response.choices[0].message.content)
  ```

  ```bash Gemini 原生格式 theme={null}
  curl -X POST "https://api.apiyi.com/v1beta/models/gemini-3.8-flash:generateContent" \
    -H "x-goog-api-key: YOUR_API_KEY" \
    -H "Content-Type: application/json" \
    -d '{
      "contents": [{"parts": [{"text": "用 Python 写一个带重试和指数退避的 HTTP 客户端"}]}]
    }'
  ```
</CodeGroup>

原生端点直接用 API易 令牌（`x-goog-api-key: sk-...`），无需 Google API Key。

### 最佳实践

* **从 3.7 平迁只改模型名**：请求结构、参数、返回字段均无变化，实测响应字段集差异仅 1 组且无类型变化，客户端不需要适配
* **按任务分配思考档位**：批量分类、抽取这类任务用 `low` 压时延，复杂重构与多步 Agent 用 `high`
* **先小流量灰度**：官方规格尚未公布，上下文上限等参数暂无官方口径。长上下文重度场景建议先小流量跑一段，确认边界后再全量切换

<Warning>
  与 `gemini-3.7-flash` 共有的几项行为，迁移时不必重新踩坑：Gemini 侧的隐式缓存命中本就不高，本轮 8 轮连打未观察到命中；显式缓存（`cachedContents`）与 `countTokens` 端点在网关侧尚未开通；OpenAI 兼容路径上的 `stop` 与 `seed` 参数不生效，需要这两个参数请走 Gemini 原生格式的 `stopSequences` 与 `seed`。以上均为两个模型共有，不是 3.8 独有。
</Warning>

## 价格与可用性

| 计费项        | 价格（每 1M tokens） |
| ---------- | --------------- |
| 输入（提示）     | \$0.7500        |
| 输出（补全，含思考） | \$3.7500        |
| 缓存读取       | \$0.0750        |

**与 `gemini-3.7-flash` 逐项一致**，从 3.7 平迁不涉及任何成本变化，原有的用量预算可直接沿用。

<Info>
  谷歌尚未公布 3.8 Flash 的官方定价。作为参考：3.7 Flash 现行的 \$0.75 / \$3.75 是谷歌自己的限时优惠价，官方注明有效期至 2026 年 12 月 31 日。若官方后续公布 3.8 的定价并与当前不同，我们会同步调整并提前公告。
</Info>

### 叠加网站充值活动

API易 的模型价格与原厂逐项对齐，**折扣通过充值加赠体现**，可与上面的价格叠加：

📖 [充值优惠活动详情](/faq/recharge-promotions)

## 总结与建议

3.8 Flash 是一次"跑在官方文档前面"的上线。在官方基准与规格公布之前，我们能给出的最有价值的信息不是转述传闻，而是一组自己跑出来的对照数据：**150 例实测下，它与 3.7 Flash 逐项对齐，没有出现任何独有的能力回退，而价格完全相同。**

因此建议很直接：**已经在用 `gemini-3.7-flash` 的场景，可以改一处模型名开始灰度**——同价、同协议、同参数，迁移成本接近于零。长上下文重度依赖的场景，等官方规格公布后再全量切换更稳妥。

<Info>
  信息来源：模型可用性与定价来自 API易 平台实测（2026 年 9 月 2 日）；发布节奏与改进方向来自第三方科技媒体报道，谷歌官方尚未发布该模型的正式说明。谷歌官方渠道：`ai.google.dev/gemini-api/docs/models`、`deepmind.google/models/gemini/flash/`。价格以 API易 模型价格页实时数据为准。
</Info>
