Skip to main content

Краткий ответ

Да. Все каналы APIYI Claude, OpenAI, Gemini, DeepSeek, Qwen и Grok поддерживают тарификацию кэша: связанные с кэшем параметры запроса передаются вверх по цепочке без изменений, поля попадания в кэш возвращаются вам без модификации, а панель тарификации показывает использование кэша отдельными строками по официальным скидочным тарифам — без необходимости какой-либо адаптации на уровне middleware в вашем коде. Попадания в кэш у Claude и OpenAI стабильны и надежны (для обоих на этом сайте есть отдельные руководства — ссылки ниже). DeepSeek, Qwen и Grok используют полностью автоматическое кэширование префикса и обычно дают попадание при стабильном префиксе — хотя восходящий сервис Grok прямо не гарантирует попадание, поэтому закладывайте в бюджет цену без кэша. Неявное кэширование Gemini поддерживается, но его коэффициент попаданий посредственный — не стройте расчет затрат на кэшировании Gemini.

Три канала вкратце

Примечания по каналу

OpenAI: полностью автоматически, без усилий

Стабильный префикс длиной не менее 1024 token приводит к автоматическому попаданию в кэш — совпавшая часть тарифицируется по 10% от цены входа, без платы за запись, так что уже 2-й запрос дает чистую экономию. Как писать запросы, чтобы они попадали в кэш, и как использовать prompt_cache_key: см. Руководство по тарификации кэширования промптов OpenAI.

Claude: ручные маркеры, максимальная экономия

Добавьте cache_control к блокам содержимого, которые хотите кэшировать; попадания тарифицируются по 0.1× (запись стоит 1.25× / 2×). Это особенно важно для Claude Code, Cline, Cursor и других сценариев с высокой нагрузкой. Учтите, что это работает только в нативном формате Anthropic (/v1/messages) — при вызове Claude через формат, совместимый с OpenAI, скидка за кэш не применяется. См. Руководство по тарификации кэширования промптов Claude.

Gemini: поддерживается, но ожидания лучше не завышать

APIYI автоматически включает неявное кэширование контекста для нативного формата Gemini, а попадания тарифицируются по официальной скидке Google. На практике, однако, процент попаданий в кэш у Gemini заметно ниже, чем у Claude / OpenAI (поведение неявного кэширования на стороне upstream не поддается управлению). Наша рекомендация:
  • Рассматривайте скидку за кэш как приятный бонус — оценивайте затраты по цене без кэша
  • Для нагрузок, чувствительных к кэшу, с длинными и часто повторяющимися префиксами, отдавайте предпочтение каналам OpenAI или Claude

Другие каналы: DeepSeek / Qwen / Grok

Кэширование на этих каналах полностью автоматическое (маркеры не нужны), нормально работает через APIYI и на практике показывает хорошие результаты: Повышение уровня попаданий работает так же, как и с OpenAI: сначала стабильный контент, затем изменчивый — не размещайте метки времени и случайные IDs в начале prompt. К «стабильному префиксу» в Руководстве по тарификации кэша OpenAI это применимо напрямую.

Как подтвердить попадание в кэш

Проверьте поля кэша в ответе usage: Значение выше 0 означает попадание в кэш. В журналах вызовов на панели управления использование кэша отображается как отдельные позиции со скидкой, которые вы можете проверить напрямую.

На что обратить внимание

Кэширование следует формату вызова: при вызове моделей Claude через формат, совместимый с OpenAI (/v1/chat/completions), вы не получите скидку на кэш Claude — для интенсивного использования Claude применяйте нативный формат /v1/messages.
  • Кэши изолированы для каждой модели: при переключении моделей (даже в пределах одной серии) ничего не используется совместно
  • Для вендоров, не перечисленных выше (Kimi и т. д.), ориентируйтесь на поля кэша, которые фактически возвращаются в ваших логах вызовов
  • Подробности официального механизма: platform.openai.com/docs/guides/prompt-caching, docs.claude.com/en/docs/build-with-claude/prompt-caching, ai.google.dev/gemini-api/docs/caching, api-docs.deepseek.com/quick_start/pricing, docs.x.ai/developers/advanced-api-usage/prompt-caching

Связанные документы

Руководство по тарификации кэша OpenAI

Автоматическое кэширование: порог 1024 token, попадания со скидкой 90%, маршрутизация по prompt_cache_key

Руководство по тарификации кэша Grok

Скидка 75% на попадания, гранулярность блоков 128 token и какой endpoint подходит для длинных разговоров

Руководство по тарификации кэша Gemini

Неявные пороги кэширования и чего ожидать

Руководство по тарификации кэша Claude

Где размещать cache_control, расчёт точки безубыточности, техники для многотурового взаимодействия

Коэффициенты моделей

Как коэффициенты группы в консоли преобразуются в цены в USD

Журналы вызовов

Изучите использование token по каждому запросу и детали тарификации кэша

Свяжитесь с нами

Поддержка WeCom

QR-код поддержки WeComОтсканируйте, чтобы добавить, или свяжитесь с поддержкойВопросы по тарификации кэша и техническая поддержка

Электронная почта

Поддержка: [email protected]Бизнес: [email protected]