Skip to main content
Gemini 3.8 Flash (gemini-3.8-flash) — мультимодальная текстовая модель, выпущенная Google 2 сентября 2026 года и принимающая текстовые, графические, видео- и аудиоданные. APIYI открыл как нативный Gemini, так и совместимые с OpenAI эндпоинты и до запуска провёл 150 парных тестов по обоим протоколам, используя gemini-3.7-flash в качестве эталона.
Gemini 3.8 Flash доступна в APIYI: имя модели — gemini-3.8-flash, она доступна в группах default и svip. Глубокое рассуждение включено по умолчанию, а thinking tokens тарифицируются как вывод, поэтому для путей, чувствительных к задержке и стоимости, снизьте уровень рассуждения или отключите его (см. раздел «Управление рассуждением» ниже).
Официальные спецификации пока не опубликованы: на момент публикации этой страницы ни в списке моделей Gemini API от Google, ни в карточке модели DeepMind нет упоминания 3.8 Flash, а публикация в блоге о запуске ещё не вышла. Поэтому контекстное окно, максимальный объём вывода, дата отсечения знаний и официальные результаты бенчмарков здесь помечены как «не опубликовано» — мы не ретранслируем и не додумываем эти данные. Всё, что помечено как измеренное, получено в результате собственного тестирования APIYI; официальные материалы будут добавлены после их публикации.

Почему это выгодно

Вдвое дешевле 3.6 Flash

$0.75 за входящие / $3.75 за исходящие на 1 млн tokens — вдвое дешевле 3.6 Flash ($1.50 / $7.50) и полностью идентично 3.7 Flash строка в строку, поэтому миграция с 3.7 ничего не стоит.

150 тестовых сценариев до запуска

Одновременно выполнены для 3.7 Flash по обоим протоколам: базовые возможности, рассуждение, параллельный вызов tools и понимание изображений и видео полностью совпадают, без регрессий, характерных только для 3.8.

Оба эндпоинта без лишних сложностей

Нативный формат Gemini (официальный SDK, ключ Google API не требуется) и формат, совместимый с OpenAI (достаточно изменить base_url), доступны оба.

Практически нулевая стоимость миграции

При переходе с 3.7 Flash требуется изменить только имя модели в одной строке: структура запроса, параметры и поля ответа не изменяются; зафиксировано одно различие в наборе полей и полное отсутствие изменений типов.

Информация о модели

Матрица проверенных возможностей

Результаты тестирования APIYI от 2 сентября 2026 года — 150 журналов случаев и 198 вызовов, при этом каждый случай запускался одновременно для gemini-3.7-flash, чтобы исключить влияние времени суток:
Поисковая привязка не подтверждена: передача tools: [{"googleSearch": {}}] возвращает 200 с правильным ответом, но ответ не содержит groundingMetadata, то есть ответ был получен из собственных знаний модели, а не в результате живого поиска. gemini-3.7-flash в том же запуске повёл себя идентично, что указывает на включение на уровне маршрута, а не на различие в возможностях модели. Если вы зависите от получения актуальных данных, сначала проверьте это на части трафика, а не проектируйте систему исходя из того, что привязка к источникам активна.

Цены

Полностью идентична построчно gemini-3.7-flash, поэтому переход с версии 3.7 ничего не меняет в ваших расходах; по сравнению с 3.6 Flash ($1.50 / $7.50) цена ровно вдвое ниже.
О ценах: tokens рассуждения тарифицируются как вывод — это самая прямая причина управлять уровнем рассуждения. Google не публиковала официальные цены для 3.8 Flash; для справки: действующая сейчас цена $0.75 / $3.75 для 3.7 Flash — это собственный промо-тариф Google на ограниченный срок, заявленный как действующий до 31 декабря 2026 года. Цены APIYI полностью соответствуют тарифам провайдера, а скидки предоставляются в виде бонусов за пополнение — см. акции на пополнение.

Управление рассуждением

Глубокое рассуждение включено по умолчанию: даже промпт «1+1» сначала расходует несколько сотен tokens на рассуждение. Измерено для трёх уровней (один и тот же вопрос, нативный эндпоинт):
Уровень minimal удалён (в 3.6 Flash он был, а в 3.8 его нет): нативный эндпоинт возвращает 400 Thinking level is unsupported: THINKING_LEVEL_MINIMAL для thinkingLevel: "minimal". Используйте thinkingConfig: {"thinkingBudget": 0}, чтобы полностью отключить рассуждение.Эндпоинт, совместимый с OpenAI, требует большей осторожности: reasoning_effort: "minimal" не вызывает ошибку — он возвращает 200, но при этом измеримо расходует 76 tokens на рассуждение, которые тарифицируются как выходные. Параметр молча игнорируется, и рассуждение всё равно выполняется. Код, перенесённый из 3.6 Flash, с установленным minimal не выдаст ошибку, указывающую на необходимость его изменить.
Чтобы просмотреть рассуждение, передайте thinkingConfig: {"includeThoughts": true} — тогда ответ будет содержать компоненты рассуждения с флагом thought: true, а данные об использовании будут находиться в usageMetadata.thoughtsTokenCount. На эндпоинте, совместимом с OpenAI, используйте reasoning_effort (низкий / средний / высокий) и прочитайте usage.completion_tokens_details.reasoning_tokens.

Примеры

Нативный формат Gemini (рекомендуется, более широкая поддержка tools)

Совместимый с OpenAI формат (без изменений в существующем коде)

Руководство по миграции

Измените только имя модели. Формат запроса, параметры и поля ответа протестированы без изменений; наборы полей ответа различаются в одной группе, но типы нигде не изменились, поэтому адаптация клиентов не требуется. Цены идентичны, поэтому ваш текущий бюджет сохраняется.
Цена снижена вдвое (ввод $1.50 → $0.75, вывод $7.50 → $3.75), но одно изменение необходимо: thinkingLevel: "minimal" больше не поддерживается, а нативный эндпоинт возвращает 400 — переключитесь на thinkingConfig: {"thinkingBudget": 0}. На OpenAI-совместимом эндпоинте reasoning_effort: "minimal" не вызовет ошибку, но будет молча проигнорирован, при этом рассуждение по-прежнему тарифицируется, поэтому это также необходимо исправить.
Google его не публиковала, и мы не будем выводить его из значения для версии 3.7. Задача поиска в длинном контексте с префиксом длиной 14,5 тыс. символов успешно прошла тестирование. Если вы активно используете длинный контекст, сначала переведите на новую модель небольшую долю трафика, подтвердите границу, а затем выполните полный переход. Эта страница будет обновлена после публикации официальных спецификаций.
Нет. Укажите свой ключ APIYI (начинающийся с sk-) непосредственно в заголовке x-goog-api-key; при использовании официального SDK google-genai просто укажите base_url как https://api.apiyi.com.
Исполнение кода, контекст URL, safetySettings и строгая обработка stopSequences и seed доступны только в нативном эндпоинте Gemini. OpenAI-совместимый эндпоинт поддерживает стандартный набор возможностей (чат / потоковая передача / вызов функций / JSON Schema / vision), но stop и seed, согласно тестированию, там не оказывают никакого эффекта.

Связанные материалы