gemini-3.5-flash-lite) — это легковесная мультимодальная модель Google, обновленная в июле 2026 года (стабильный релиз), предназначенная для высокочастотных, низколатентных и недорогих нагрузок. Она принимает входные данные текст/изображение/видео/аудио/PDF с контекстным окном 1M и выводом 64K. APIYI завершила полный прогон тестов по двум эндпоинтам (25+5 случаев): и нативный формат Gemini, и формат, совместимый с OpenAI, работают сразу, а нативные инструменты — поисковая привязка, контекст URL — подтверждены как работающие.
Доступно на APIYI сейчас: имя модели
gemini-3.5-flash-lite, в группах default / svip. В отличие от 3.6 Flash — без вывода рассуждений по умолчанию, простые запросы в наших тестах возвращаются примерно за 2 секунды; передайте thinkingLevel: "high", чтобы явно включить глубокое рассуждение.Ключевые особенности
Лучшая в классе ценность
$0.30 input / $2.50 output за 1M tokens (audio input по той же ставке) — от одной пятой до одной трети от 3.6 Flash. Создано для высокочастотных и пакетных нагрузок.
Без thinking, минимальная задержка
По умолчанию без thinking tokens; простые запросы выполняются примерно за ~2s (против ~4.5s на 3.6 Flash). Готово к использованию сразу для ботов поддержки, классификации и извлечения.
Полное мультимодальное понимание
Изображения, PDF и audio подтверждены как точные (video использует тот же pipeline), с тем же контекстным окном 1M, что и у флагмана.
Нативные инструменты доступны
Grounding для Google Search, grounding для Maps, URL context и code execution подтверждены как работающие на нативном эндпоинте — ключ API Google не требуется.
Сведения о модели
Проверенная матрица возможностей
Результаты тестирования APIYI от 22 июля 2026 года (официальные заявления vs. измеренное поведение):Тарифы
Примечание по тарифам: APIYI соответствует официальным ценам; скидка складывается из бонусов за пополнение: +10% при $100, до +20% (≈17% скидки). См. акции на пополнение.
Управление рассуждением
В отличие от 3.6 Flash — эта модель не думает по умолчанию, поэтому она и быстрая, и дешевая. Измерено:Краткий старт
Нативный формат Gemini (рекомендуется — полная поддержка инструментов)
Формат, совместимый с OpenAI (готовая замена для существующего кода)
Часто задаваемые вопросы
Когда следует выбирать Flash-Lite вместо 3.6 Flash?
Когда следует выбирать Flash-Lite вместо 3.6 Flash?
Выбирайте Flash-Lite для нагрузок, ориентированных на пропускную способность: частые Q&A, классификация, извлечение, перевод, боты поддержки (примерно вдвое быстрее, стоимость — до одной пятой). Выбирайте 3.6 Flash для глубокого рассуждения, сложного планирования или Computer Use.
Нужен ли мне Google API Key для нативного эндпоинта?
Нужен ли мне Google API Key для нативного эндпоинта?
Нет. Поместите ваш APIYI token (ключ
sk-) в заголовок x-goog-api-key. В официальном SDK google-genai просто задайте base_url как https://api.apiyi.com.Как отслеживать расход на thinking?
Как отслеживать расход на thinking?
На нативном эндпоинте читайте
usageMetadata.thoughtsTokenCount. Обратите внимание: эндпоинт, совместимый с OpenAI, не сообщает reasoning_tokens для этой модели — используйте нативный эндпоинт для точного наблюдения.Срабатывает ли неявное кэширование?
Срабатывает ли неявное кэширование?
Мы наблюдали ноль попаданий в кэш за три подряд запроса с общим префиксом на 15,9K-token (3.6 Flash попал в кэш один раз при тех же условиях). Не стройте модели стоимости на основе попаданий в кэш. Явный API кэша пока не включен на платформе.