Skip to main content
Канал Gemini в APIYI автоматически включает неявное кэширование контекста: при совпадении префикса запроса совпавшая часть тарифицируется по официальной скидке, а поле cached_content_token_count возвращается без изменений — без каких-либо изменений кода. Сразу главное: кэширование Gemini существует, но на него не стоит рассчитывать. Поведение неявного кэша определяется на стороне upstream, и реальные показатели попаданий заметно уступают OpenAI и Claude. Рассматривайте это как приятный бонус и всегда оценивайте стоимость по цене без кэширования. Эта страница основана на официальной документации Google (ai.google.dev/gemini-api/docs/caching, по состоянию на июнь 2026 года).

Механизм в одном предложении

Когда открывающий сегмент (префикс) запроса совпадает с недавним запросом и достигает минимальной длины, upstream автоматически повторно использует свой кэш: совпавшая часть тарифицируется по официальной скидке (официально до 90%), без каких-либо маркеров.

Условия срабатывания

Обратите внимание: порог кэширования у Gemini (4096) значительно выше, чем у OpenAI (1024) — короткие system prompts на Gemini практически никогда не дают попадание в кэш, и именно поэтому кэширование Gemini кажется неубедительным.

Как подтвердить попадание

Проверьте usage_metadata.cached_content_token_count:
Попадания отображаются как строки со скидкой в панели тарификации; в ответах REST поле — usageMetadata.cachedContentTokenCount.

Повышение ваших шансов

Тот же подход, что и у OpenAI (подробное объяснение в Руководстве по тарификации кэша OpenAI):
  • Сначала стабильный контент: длинные системные инструкции, документы, few-shot-примеры в начале; ввод пользователя и временные метки — в конце
  • Сделайте префикс длинным: все, что короче 4096 token (серия Gemini 3), никогда не попадает в кэш
  • Сгруппируйте повторное использование по времени: отправляйте batch-задачи одну за другой, не растягивайте их во времени
  • Многотуровые чаты по своей природе образуют префиксы только с добавлением и легче попадают в кэш
Даже если вы все сделаете правильно, попадание в кэш не гарантировано — неявное кэширование работает по возможности, в отличие от детерминированного поведения OpenAI/Claude.

Явное кэширование (cachedContents)

Google также предлагает API явного кэширования (cachedContents — создайте объект кэша с TTL и укажите на него ссылку). Это ресурс на стороне сервера с состоянием, который в настоящее время не поддерживается в канале APIYI; используйте неявное кэширование.

Сравнение с другими каналами

Для нагрузок, чувствительных к кэшированию, с длинными и часто повторяющимися префиксами (агенты, RAG, пакетные документы), предпочитайте каналы OpenAI или Claude. Обзор поддержки кэша по всей платформе: FAQ по тарификации кэша.

Связанные ссылки