Skip to main content
Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) — это легковесная мультимодальная модель Google, обновленная в июле 2026 года (стабильный релиз), предназначенная для высокочастотных, низколатентных и недорогих нагрузок. Она принимает входные данные текст/изображение/видео/аудио/PDF с контекстным окном 1M и выводом 64K. APIYI завершила полный прогон тестов по двум эндпоинтам (25+5 случаев): и нативный формат Gemini, и формат, совместимый с OpenAI, работают сразу, а нативные инструменты — поисковая привязка, контекст URL — подтверждены как работающие.
Доступно на APIYI сейчас: имя модели gemini-3.5-flash-lite, в группах default / svip. В отличие от 3.6 Flash — без вывода рассуждений по умолчанию, простые запросы в наших тестах возвращаются примерно за 2 секунды; передайте thinkingLevel: "high", чтобы явно включить глубокое рассуждение.

Ключевые особенности

Лучшая в классе ценность

$0.30 input / $2.50 output за 1M tokens (audio input по той же ставке) — от одной пятой до одной трети от 3.6 Flash. Создано для высокочастотных и пакетных нагрузок.

Без thinking, минимальная задержка

По умолчанию без thinking tokens; простые запросы выполняются примерно за ~2s (против ~4.5s на 3.6 Flash). Готово к использованию сразу для ботов поддержки, классификации и извлечения.

Полное мультимодальное понимание

Изображения, PDF и audio подтверждены как точные (video использует тот же pipeline), с тем же контекстным окном 1M, что и у флагмана.

Нативные инструменты доступны

Grounding для Google Search, grounding для Maps, URL context и code execution подтверждены как работающие на нативном эндпоинте — ключ API Google не требуется.

Сведения о модели

Проверенная матрица возможностей

Результаты тестирования APIYI от 22 июля 2026 года (официальные заявления vs. измеренное поведение):

Тарифы

Примечание по тарифам: APIYI соответствует официальным ценам; скидка складывается из бонусов за пополнение: +10% при $100, до +20% (≈17% скидки). См. акции на пополнение.

Управление рассуждением

В отличие от 3.6 Flash — эта модель не думает по умолчанию, поэтому она и быстрая, и дешевая. Измерено:
Практическое правило: когда вам нужно рассуждение, сразу переходите к high — промежуточные уровни не запускают его на простых prompt’ах. Используйте вместе с includeThoughts: true, чтобы просматривать ход рассуждений. Если вашей нагрузке постоянно нужно глубокое рассуждение, Gemini 3.6 Flash — более подходящий вариант.

Краткий старт

Нативный формат Gemini (рекомендуется — полная поддержка инструментов)

Формат, совместимый с OpenAI (готовая замена для существующего кода)

Часто задаваемые вопросы

Выбирайте Flash-Lite для нагрузок, ориентированных на пропускную способность: частые Q&A, классификация, извлечение, перевод, боты поддержки (примерно вдвое быстрее, стоимость — до одной пятой). Выбирайте 3.6 Flash для глубокого рассуждения, сложного планирования или Computer Use.
Нет. Поместите ваш APIYI token (ключ sk-) в заголовок x-goog-api-key. В официальном SDK google-genai просто задайте base_url как https://api.apiyi.com.
На нативном эндпоинте читайте usageMetadata.thoughtsTokenCount. Обратите внимание: эндпоинт, совместимый с OpenAI, не сообщает reasoning_tokens для этой модели — используйте нативный эндпоинт для точного наблюдения.
Мы наблюдали ноль попаданий в кэш за три подряд запроса с общим префиксом на 15,9K-token (3.6 Flash попал в кэш один раз при тех же условиях). Не стройте модели стоимости на основе попаданий в кэш. Явный API кэша пока не включен на платформе.

Связанные