Skip to main content
Gemini 3.6 Flash (gemini-3.6-flash) — это мультимодальная текстовая модель Google, обновленная в июле 2026 года (стабильный выпуск), которая принимает input text/image/video/audio/PDF с контекстным окном 1M и выводом 64K. APIYI завершил полный тестовый прогон по двум эндпоинтам (26+5 тестовых случаев): как нативный формат Gemini, так и совместимый с OpenAI формат работают без дополнительных настроек, а встроенные инструменты — Search grounding, выполнение кода, URL context — подтверждены как работающие.
Доступно в APIYI уже сейчас: имя модели gemini-3.6-flash, в группах default / svip. Thinking включен по умолчанию (thinking tokens тарифицируются как output) — снижайте уровень Thinking для нагрузок, чувствительных к задержке или стоимости (см. «Управление Thinking» ниже). Для легких нагрузок рассмотрите более дешевый вариант Gemini 3.5 Flash-Lite.

Основные особенности

Полный нативный набор инструментов

Google Search grounding, Maps grounding, URL context, выполнение кода и Computer Use (предварительная версия) — все подтверждено как работающее на нативном эндпоинте; ключ API Google не требуется.

Полное мультимодальное понимание

Входные данные Image, PDF и audio подтверждены как точные (video использует тот же pipeline). Контекст 1M помещает целую книгу или codebase.

Четыре уровня рассуждения

thinkingLevel minimal/low/medium/high измеряется на уровне 0/403/487/837 thinking tokens — монотонно, поэтому вы можете точно планировать рассуждение для каждой задачи.

Два эндпоинта, без лишних действий

Нативный формат Gemini (официальный SDK, просто измените base_url) и формат, совместимый с OpenAI, оба доступны по официальной тарификации.

Подробности модели

Проверенная матрица возможностей

Результаты тестирования APIYI от 22 июля 2026 года (официальные заявления vs. измеренное поведение):
Примечание по выполнению кода: наши тесты подтверждают, что код действительно выполняется на стороне upstream (задача sha256, которую нельзя запомнить, вернула правильный digest), но части executableCode / codeExecutionResult сейчас не возвращаются в ответе — код и его результат вместо этого появляются в теле текста. Приложениям, которые отображают эти два поля отдельно, стоит это учесть.

Тарификация

Примечание по тарификации: thinking tokens тарифицируются как output — основная причина управлять уровнями thinking. APIYI соответствует официальной тарификации; скидка складывается из бонусов за пополнение: +10% на $100, до +20% (≈17% скидки). См. акции на пополнение.

Управление рассуждением

Рассуждение включено по умолчанию: даже «1+1» сначала генерирует ~200 tokens рассуждения. Измеренные уровни:
Передайте thinkingConfig: {"includeThoughts": true}, чтобы получить обратно части рассуждения (помеченные thought: true); расход отображается в usageMetadata.thoughtsTokenCount. На совместимом с OpenAI эндпоинте используйте reasoning_effort (низкий/средний/высокий) и читайте usage.completion_tokens_details.reasoning_tokens.

Быстрый старт

Нативный формат Gemini (рекомендуется — полная поддержка инструментов)

Формат, совместимый с OpenAI (готовая замена для существующего кода)

Частые вопросы

Нет. Поместите ваш APIYI token (ключ sk-) в заголовок x-goog-api-key. С официальным google-genai SDK просто задайте base_url равным https://api.apiyi.com.
Нет. google_search, url_context, codeExecution, привязка к Maps и Computer Use доступны только в нативном формате. OpenAI-совместимый эндпоинт охватывает стандартный набор: чат, потоковую передачу, вызов функций, JSON Schema и vision.
Повторяющийся длинный префикс может попасть в кэш при втором запросе (измерено: 8,176 из префикса в 15.9K-token), но попадания вероятностные — не стройте на них модели затрат. Явный API кэша (cachedContents) пока не включен на платформе.
Выберите 3.6 Flash для инструментов, глубокого thinking и более сильного рассуждения. Выберите 3.5 Flash-Lite ($0.30 на вход / $2.50 на выход, без thinking по умолчанию, примерно вдвое быстрее) для высокочастотных задач, чувствительных к задержке и стоимости.

Связанные