gemini-3.6-flash) — это мультимодальная текстовая модель Google, обновленная в июле 2026 года (стабильный выпуск), которая принимает input text/image/video/audio/PDF с контекстным окном 1M и выводом 64K. APIYI завершил полный тестовый прогон по двум эндпоинтам (26+5 тестовых случаев): как нативный формат Gemini, так и совместимый с OpenAI формат работают без дополнительных настроек, а встроенные инструменты — Search grounding, выполнение кода, URL context — подтверждены как работающие.
Доступно в APIYI уже сейчас: имя модели
gemini-3.6-flash, в группах default / svip. Thinking включен по умолчанию (thinking tokens тарифицируются как output) — снижайте уровень Thinking для нагрузок, чувствительных к задержке или стоимости (см. «Управление Thinking» ниже). Для легких нагрузок рассмотрите более дешевый вариант Gemini 3.5 Flash-Lite.Основные особенности
Полный нативный набор инструментов
Google Search grounding, Maps grounding, URL context, выполнение кода и Computer Use (предварительная версия) — все подтверждено как работающее на нативном эндпоинте; ключ API Google не требуется.
Полное мультимодальное понимание
Входные данные Image, PDF и audio подтверждены как точные (video использует тот же pipeline). Контекст 1M помещает целую книгу или codebase.
Четыре уровня рассуждения
thinkingLevel minimal/low/medium/high измеряется на уровне 0/403/487/837 thinking tokens — монотонно, поэтому вы можете точно планировать рассуждение для каждой задачи.
Два эндпоинта, без лишних действий
Нативный формат Gemini (официальный SDK, просто измените base_url) и формат, совместимый с OpenAI, оба доступны по официальной тарификации.
Подробности модели
Проверенная матрица возможностей
Результаты тестирования APIYI от 22 июля 2026 года (официальные заявления vs. измеренное поведение):Тарификация
Примечание по тарификации: thinking tokens тарифицируются как output — основная причина управлять уровнями thinking. APIYI соответствует официальной тарификации; скидка складывается из бонусов за пополнение: +10% на $100, до +20% (≈17% скидки). См. акции на пополнение.
Управление рассуждением
Рассуждение включено по умолчанию: даже «1+1» сначала генерирует ~200 tokens рассуждения. Измеренные уровни:Быстрый старт
Нативный формат Gemini (рекомендуется — полная поддержка инструментов)
Формат, совместимый с OpenAI (готовая замена для существующего кода)
Частые вопросы
Нужен ли мне Google API Key для нативного эндпоинта?
Нужен ли мне Google API Key для нативного эндпоинта?
Нет. Поместите ваш APIYI token (ключ
sk-) в заголовок x-goog-api-key. С официальным google-genai SDK просто задайте base_url равным https://api.apiyi.com.Работают ли привязка к поиску / выполнение кода на OpenAI-совместимом эндпоинте?
Работают ли привязка к поиску / выполнение кода на OpenAI-совместимом эндпоинте?
Нет. google_search, url_context, codeExecution, привязка к Maps и Computer Use доступны только в нативном формате. OpenAI-совместимый эндпоинт охватывает стандартный набор: чат, потоковую передачу, вызов функций, JSON Schema и vision.
Сколько экономит неявное кэширование?
Сколько экономит неявное кэширование?
Повторяющийся длинный префикс может попасть в кэш при втором запросе (измерено: 8,176 из префикса в 15.9K-token), но попадания вероятностные — не стройте на них модели затрат. Явный API кэша (cachedContents) пока не включен на платформе.
Gemini 3.6 Flash или 3.5 Flash-Lite?
Gemini 3.6 Flash или 3.5 Flash-Lite?
Выберите 3.6 Flash для инструментов, глубокого thinking и более сильного рассуждения. Выберите 3.5 Flash-Lite ($0.30 на вход / $2.50 на выход, без thinking по умолчанию, примерно вдвое быстрее) для высокочастотных задач, чувствительных к задержке и стоимости.