cached_content_token_count возвращается без изменений — без каких-либо изменений кода.
Сразу главное: кэширование Gemini существует, но на него не стоит рассчитывать. Поведение неявного кэша определяется на стороне upstream, и реальные показатели попаданий заметно уступают OpenAI и Claude. Рассматривайте это как приятный бонус и всегда оценивайте стоимость по цене без кэширования.
Эта страница основана на официальной документации Google (ai.google.dev/gemini-api/docs/caching, по состоянию на июнь 2026 года).
Механизм в одном предложении
Когда открывающий сегмент (префикс) запроса совпадает с недавним запросом и достигает минимальной длины, upstream автоматически повторно использует свой кэш: совпавшая часть тарифицируется по официальной скидке (официально до 90%), без каких-либо маркеров.Условия срабатывания
Обратите внимание: порог кэширования у Gemini (4096) значительно выше, чем у OpenAI (1024) — короткие system prompts на Gemini практически никогда не дают попадание в кэш, и именно поэтому кэширование Gemini кажется неубедительным.
Как подтвердить попадание
Проверьтеusage_metadata.cached_content_token_count:
usageMetadata.cachedContentTokenCount.
Повышение ваших шансов
Тот же подход, что и у OpenAI (подробное объяснение в Руководстве по тарификации кэша OpenAI):- Сначала стабильный контент: длинные системные инструкции, документы, few-shot-примеры в начале; ввод пользователя и временные метки — в конце
- Сделайте префикс длинным: все, что короче 4096 token (серия Gemini 3), никогда не попадает в кэш
- Сгруппируйте повторное использование по времени: отправляйте batch-задачи одну за другой, не растягивайте их во времени
- Многотуровые чаты по своей природе образуют префиксы только с добавлением и легче попадают в кэш
Явное кэширование (cachedContents)
Google также предлагает API явного кэширования (cachedContents — создайте объект кэша с TTL и укажите на него ссылку). Это ресурс на стороне сервера с состоянием, который в настоящее время не поддерживается в канале APIYI; используйте неявное кэширование.
Сравнение с другими каналами
Для нагрузок, чувствительных к кэшированию, с длинными и часто повторяющимися префиксами (агенты, RAG, пакетные документы), предпочитайте каналы OpenAI или Claude. Обзор поддержки кэша по всей платформе: FAQ по тарификации кэша.
Связанные ссылки
- Эта группа: Native Calls · Multimodal & Code Execution · Function Calling
- Другие каналы: OpenAI Cache Billing · Claude Cache Billing
- Официальная документация Google:
ai.google.dev/gemini-api/docs/caching