> ## Documentation Index
> Fetch the complete documentation index at: https://docs.apiyi.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Генерация текста с Gemini 3.8 Flash

> Мультимодальная текстовая модель Gemini 3.8 Flash от Google на APIYI: оба эндпоинта открыты, $0.75 за входящие / $3.75 за исходящие за 1M tokens — вдвое дешевле, чем у 3.6 Flash. Включает результаты 150 предрелизных тестов и примечания по миграции с 3.6 / 3.7.

Gemini 3.8 Flash (`gemini-3.8-flash`) — мультимодальная текстовая модель, выпущенная Google 2 сентября 2026 года и принимающая текстовые, графические, видео- и аудиоданные. APIYI открыл как **нативный Gemini**, так и **совместимые с OpenAI** эндпоинты и до запуска провёл **150 парных тестов по обоим протоколам**, используя `gemini-3.7-flash` в качестве эталона.

<Info>
  **Gemini 3.8 Flash доступна в APIYI**: имя модели — `gemini-3.8-flash`, она доступна в группах `default` и `svip`. **Глубокое рассуждение включено по умолчанию**, а thinking tokens тарифицируются как вывод, поэтому для путей, чувствительных к задержке и стоимости, снизьте уровень рассуждения или отключите его (см. раздел «Управление рассуждением» ниже).
</Info>

<Warning>
  **Официальные спецификации пока не опубликованы**: на момент публикации этой страницы ни в списке моделей Gemini API от Google, ни в карточке модели DeepMind нет упоминания 3.8 Flash, а публикация в блоге о запуске ещё не вышла. Поэтому **контекстное окно, максимальный объём вывода, дата отсечения знаний и официальные результаты бенчмарков здесь помечены как «не опубликовано»** — мы не ретранслируем и не додумываем эти данные. Всё, что помечено как измеренное, получено в результате собственного тестирования APIYI; официальные материалы будут добавлены после их публикации.
</Warning>

## Почему это выгодно

<CardGroup cols={2}>
  <Card title="Вдвое дешевле 3.6 Flash" icon="dollar-sign">
    \$0.75 за входящие / \$3.75 за исходящие на 1 млн tokens — вдвое дешевле 3.6 Flash (\$1.50 / \$7.50) и полностью идентично 3.7 Flash строка в строку, поэтому миграция с 3.7 ничего не стоит.
  </Card>

  <Card title="150 тестовых сценариев до запуска" icon="clipboard-check">
    Одновременно выполнены для 3.7 Flash по обоим протоколам: базовые возможности, рассуждение, параллельный вызов tools и понимание изображений и видео полностью совпадают, без регрессий, характерных только для 3.8.
  </Card>

  <Card title="Оба эндпоинта без лишних сложностей" icon="git-fork">
    Нативный формат Gemini (официальный SDK, ключ Google API не требуется) и формат, совместимый с OpenAI (достаточно изменить base\_url), доступны оба.
  </Card>

  <Card title="Практически нулевая стоимость миграции" icon="arrow-right-arrow-left">
    При переходе с 3.7 Flash требуется изменить только имя модели в одной строке: структура запроса, параметры и поля ответа не изменяются; зафиксировано одно различие в наборе полей и полное отсутствие изменений типов.
  </Card>
</CardGroup>

## Информация о модели

| Поле                                             | Значение                                                                                                                |
| ------------------------------------------------ | ----------------------------------------------------------------------------------------------------------------------- |
| **Название модели**                              | `gemini-3.8-flash`                                                                                                      |
| **Входные модальности**                          | текст, изображение, видео, аудио (изображения и видео проверены)                                                        |
| **Выходная модальность**                         | текст                                                                                                                   |
| **Контекстное окно / максимальный объём вывода** | Google не публикует                                                                                                     |
| **Дата отсечения знаний**                        | Google не публикует                                                                                                     |
| **Группы**                                       | `default`, `svip`                                                                                                       |
| **Эндпоинты**                                    | `POST /v1beta/models/gemini-3.8-flash:generateContent` (нативный), `POST /v1/chat/completions` (совместимый с OpenAI)   |
| **Глубокое мышление**                            | включено по умолчанию; `thinkingLevel` имеет три уровня (низкий / средний / высокий); `thinkingBudget: 0` отключает его |
| **Потоковая передача**                           | ✅ включена для обоих эндпоинтов                                                                                         |

## Матрица проверенных возможностей

Результаты тестирования APIYI от 2 сентября 2026 года — 150 журналов случаев и 198 вызовов, при этом каждый случай запускался **одновременно** для `gemini-3.7-flash`, чтобы исключить влияние времени суток:

| Возможность                                                                      | Нативный Gemini                                                          | Совместимый с OpenAI                 | по сравнению с 3.7 Flash                     |
| -------------------------------------------------------------------------------- | ------------------------------------------------------------------------ | ------------------------------------ | -------------------------------------------- |
| Базовый чат (без потоковой передачи / потоковая передача)                        | ✅ / ✅                                                                    | ✅ / ✅                                | одинаково                                    |
| Системная инструкция                                                             | ✅                                                                        | ✅                                    | одинаково                                    |
| Несколько ходов диалога                                                          | ✅                                                                        | ✅                                    | одинаково                                    |
| Поиск в длинном контексте (префикс из 14,5 тыс. символов, ограничение 128 token) | ✅                                                                        | ✅                                    | одинаковый ответ                             |
| Структурированный вывод                                                          | ✅ responseSchema                                                         | ✅ json\_schema                       | возвращён побайтно идентичный JSON           |
| Вызов функций (одиночный / возврат управления / последовательный)                | ✅                                                                        | ✅                                    | одинаково                                    |
| **Параллельный вызов функций**                                                   | ✅ два вызова с неизменёнными аргументами и ID в течение двух раундов     | ✅                                    | одинаково                                    |
| Понимание изображений                                                            | ✅ 2/2                                                                    | ✅ 2/2                                | количество token модальности IMAGE идентично |
| Понимание видео                                                                  | ✅ 2/2                                                                    | ✅ 2/2                                | количество token модальности VIDEO идентично |
| Выполнение кода (`codeExecution`)                                                | ✅ правильный ответ                                                       | — только в нативном режиме           | одинаково                                    |
| Контекст URL (`urlContext`)                                                      | ✅ возвращает `urlContextMetadata`; страница действительно была загружена | — только в нативном режиме           | одинаково                                    |
| Низкий / средний / высокий уровни рассуждения                                    | ✅ количество token рассуждения монотонно увеличивается                   | ✅ `reasoning_effort` вступает в силу | одинаково                                    |
| `stopSequences` / `stop`                                                         | ✅ строго соблюдаются                                                     | ⚠️ эффекта нет                       | одинаково                                    |
| `temperature=0` + `topK=1` + `seed`                                              | ✅ два запуска идентичны слово в слово                                    | ⚠️ два запуска различаются           | одинаково                                    |
| `safetySettings`                                                                 | ✅ принят, возвращает `safetyRatings`                                     | — только в нативном режиме           | одинаково                                    |
| Поиск Google с привязкой к источникам                                            | ⚠️ запрос принят, но `groundingMetadata` отсутствует (см. ниже)          | — только в нативном режиме           | одинаково                                    |
| Неявное кэширование                                                              | ⚠️ за 8 последовательных раундов попаданий в кэш не обнаружено           | одинаково                            | одинаково                                    |
| Явные `cachedContents` / `:countTokens`                                          | ❌ не включены на платформе                                               | —                                    | одинаково                                    |

<Warning>
  **Поисковая привязка не подтверждена**: передача `tools: [{"googleSearch": {}}]` возвращает 200 с правильным ответом, но ответ не содержит **`groundingMetadata`**, то есть ответ был получен из собственных знаний модели, а не в результате живого поиска. `gemini-3.7-flash` в том же запуске повёл себя идентично, что указывает на **включение на уровне маршрута, а не на различие в возможностях модели**. Если вы зависите от получения актуальных данных, сначала проверьте это на части трафика, а не проектируйте систему исходя из того, что привязка к источникам активна.
</Warning>

## Цены

| Позиция                      | Цена APIYI          |
| ---------------------------- | ------------------- |
| Ввод                         | \$0.75 / 1M tokens  |
| Вывод (рассуждение включено) | \$3.75 / 1M tokens  |
| Чтение из кэша               | \$0.075 / 1M tokens |

**Полностью идентична построчно `gemini-3.7-flash`**, поэтому переход с версии 3.7 ничего не меняет в ваших расходах; по сравнению с 3.6 Flash (\$1.50 / \$7.50) цена **ровно вдвое ниже**.

<Info>
  **О ценах**: tokens рассуждения тарифицируются как вывод — это самая прямая причина управлять уровнем рассуждения. Google не публиковала официальные цены для 3.8 Flash; для справки: действующая сейчас цена \$0.75 / \$3.75 для 3.7 Flash — это собственный промо-тариф Google на ограниченный срок, заявленный как действующий до 31 декабря 2026 года. Цены APIYI полностью соответствуют тарифам провайдера, а скидки предоставляются в виде бонусов за пополнение — см. [акции на пополнение](/ru/faq/recharge-promotions).
</Info>

## Управление рассуждением

**Глубокое рассуждение включено по умолчанию**: даже промпт «1+1» сначала расходует несколько сотен tokens на рассуждение. Измерено для трёх уровней (один и тот же вопрос, нативный эндпоинт):

| Параметр                                | Tokens на рассуждение (измерено)              | Подходит для                                                 |
| --------------------------------------- | --------------------------------------------- | ------------------------------------------------------------ |
| `thinkingConfig: {"thinkingBudget": 0}` | 0 (`thoughtsTokenCount` отсутствует в ответе) | короткие промпты с высокой частотой, пути с учётом стоимости |
| `thinkingLevel: "low"`                  | 84                                            | повседневное рассуждение                                     |
| `thinkingLevel: "medium"`               | 127                                           | анализ средней сложности                                     |
| `thinkingLevel: "high"`                 | 263                                           | сложное планирование, математика, анализ кода                |

<Warning>
  **Уровень `minimal` удалён** (в 3.6 Flash он был, а в 3.8 его нет): нативный эндпоинт возвращает 400 `Thinking level is unsupported: THINKING_LEVEL_MINIMAL` для `thinkingLevel: "minimal"`. Используйте `thinkingConfig: {"thinkingBudget": 0}`, чтобы полностью отключить рассуждение.

  **Эндпоинт, совместимый с OpenAI, требует большей осторожности**: `reasoning_effort: "minimal"` **не вызывает ошибку** — он возвращает 200, но при этом измеримо расходует 76 tokens на рассуждение, которые тарифицируются как выходные. Параметр молча игнорируется, и рассуждение всё равно выполняется. Код, перенесённый из 3.6 Flash, с установленным `minimal` не выдаст ошибку, указывающую на необходимость его изменить.
</Warning>

<Tip>
  Чтобы просмотреть рассуждение, передайте `thinkingConfig: {"includeThoughts": true}` — тогда ответ будет содержать компоненты рассуждения с флагом `thought: true`, а данные об использовании будут находиться в `usageMetadata.thoughtsTokenCount`. На эндпоинте, совместимом с OpenAI, используйте `reasoning_effort` (низкий / средний / высокий) и прочитайте `usage.completion_tokens_details.reasoning_tokens`.
</Tip>

## Примеры

### Нативный формат Gemini (рекомендуется, более широкая поддержка tools)

<CodeGroup>
  ```bash cURL (базовый чат, рассуждение отключено) theme={null}
  curl -X POST "https://api.apiyi.com/v1beta/models/gemini-3.8-flash:generateContent" \
    -H "x-goog-api-key: YOUR_API_KEY" \
    -H "Content-Type: application/json" \
    -d '{
      "contents": [{"parts": [{"text": "Introduce yourself in one sentence"}]}],
      "generationConfig": {"thinkingConfig": {"thinkingBudget": 0}}
    }'
  ```

  ```python Python (google-genai SDK) theme={null}
  from google import genai
  from google.genai import types

  client = genai.Client(
      api_key="YOUR_API_KEY",
      http_options=types.HttpOptions(base_url="https://api.apiyi.com")
  )

  response = client.models.generate_content(
      model="gemini-3.8-flash",
      contents="Analyze the time complexity of this code and suggest optimizations",
      config=types.GenerateContentConfig(
          thinking_config=types.ThinkingConfig(thinking_level="high")
      )
  )
  print(response.text)
  ```

  ```python Python (контекст URL, работоспособность проверена) theme={null}
  from google import genai
  from google.genai import types

  client = genai.Client(
      api_key="YOUR_API_KEY",
      http_options=types.HttpOptions(base_url="https://api.apiyi.com")
  )

  response = client.models.generate_content(
      model="gemini-3.8-flash",
      contents="Summarize what https://ai.google.dev/gemini-api/docs covers",
      config=types.GenerateContentConfig(
          tools=[types.Tool(url_context=types.UrlContext())]
      )
  )
  print(response.text)
  ```
</CodeGroup>

### Совместимый с OpenAI формат (без изменений в существующем коде)

<CodeGroup>
  ```python Python (SDK OpenAI) theme={null}
  from openai import OpenAI

  client = OpenAI(
      api_key="YOUR_API_KEY",
      base_url="https://api.apiyi.com/v1"
  )

  response = client.chat.completions.create(
      model="gemini-3.8-flash",
      messages=[{"role": "user", "content": "Analyze the time complexity of this code"}],
      reasoning_effort="high",
      max_tokens=4000
  )
  print(response.choices[0].message.content)
  ```

  ```javascript Node.js (потоковая передача) theme={null}
  import OpenAI from 'openai';

  const client = new OpenAI({
    apiKey: 'YOUR_API_KEY',
    baseURL: 'https://api.apiyi.com/v1'
  });

  const stream = await client.chat.completions.create({
    model: 'gemini-3.8-flash',
    messages: [{ role: 'user', content: 'Write a short poem about autumn' }],
    stream: true
  });

  for await (const chunk of stream) {
    process.stdout.write(chunk.choices[0]?.delta?.content ?? '');
  }
  ```
</CodeGroup>

## Руководство по миграции

<AccordionGroup>
  <Accordion title="При переходе с gemini-3.7-flash">
    **Измените только имя модели.** Формат запроса, параметры и поля ответа протестированы без изменений; наборы полей ответа различаются в одной группе, но типы нигде не изменились, поэтому адаптация клиентов не требуется. Цены идентичны, поэтому ваш текущий бюджет сохраняется.
  </Accordion>

  <Accordion title="При переходе с gemini-3.6-flash">
    Цена **снижена вдвое** (ввод \$1.50 → \$0.75, вывод \$7.50 → \$3.75), но одно изменение необходимо: **`thinkingLevel: "minimal"` больше не поддерживается**, а нативный эндпоинт возвращает 400 — переключитесь на `thinkingConfig: {"thinkingBudget": 0}`. На OpenAI-совместимом эндпоинте `reasoning_effort: "minimal"` не вызовет ошибку, но будет молча проигнорирован, при этом рассуждение по-прежнему тарифицируется, поэтому это также необходимо исправить.
  </Accordion>

  <Accordion title="Каково ограничение контекста?">
    Google его не публиковала, и мы не будем выводить его из значения для версии 3.7. Задача поиска в длинном контексте с префиксом длиной 14,5 тыс. символов успешно прошла тестирование. **Если вы активно используете длинный контекст, сначала переведите на новую модель небольшую долю трафика**, подтвердите границу, а затем выполните полный переход. Эта страница будет обновлена после публикации официальных спецификаций.
  </Accordion>

  <Accordion title="Требуется ли для нативного эндпоинта API-ключ Google?">
    Нет. Укажите свой ключ APIYI (начинающийся с `sk-`) непосредственно в заголовке `x-goog-api-key`; при использовании официального SDK google-genai просто укажите `base_url` как `https://api.apiyi.com`.
  </Accordion>

  <Accordion title="Какие возможности доступны только в нативном режиме?">
    Исполнение кода, контекст URL, `safetySettings` и строгая обработка `stopSequences` и `seed` доступны только в нативном эндпоинте Gemini. OpenAI-совместимый эндпоинт поддерживает стандартный набор возможностей (чат / потоковая передача / вызов функций / JSON Schema / vision), но `stop` и `seed`, согласно тестированию, там не оказывают никакого эффекта.
  </Accordion>
</AccordionGroup>

## Связанные материалы

* [Примечания к запуску Gemini 3.8 Flash (полные данные тестирования)](/en/news/gemini-3-8-flash-launch)
* [Обзор Gemini 3.6 Flash](/ru/api-capabilities/gemini-3-6-flash/overview)
* [Обзор Gemini 3.5 Flash-Lite](/ru/api-capabilities/gemini-3-5-flash-lite/overview)
* [Руководство по нативному вызову Gemini](/ru/api-capabilities/gemini/native)
