Skip to main content

Краткий ответ

Да. Все каналы APIYI Claude, OpenAI, Gemini, DeepSeek, Qwen и Grok поддерживают тарификацию кэша: параметры запросов, связанные с кэшем, передаются вверх по цепочке без изменений, поля cache-hit возвращаются без изменений, а в панели тарификации использование кэша отображается отдельными позициями по официальным дисконтным ставкам — в вашем коде не требуется никакой специфической для middleware адаптации. Попадания в кэш у Claude и OpenAI стабильны и надежны (у обоих есть отдельные руководства на этом сайте — ссылки ниже). DeepSeek, Qwen и Grok тоже работают хорошо. Неявное кэширование Gemini поддерживается, но его процент попаданий посредственный — не закладывайте кэширование Gemini в основу расчета бюджета.

Три канала вкратце

Примечания по каналу

OpenAI: полностью автоматически, без усилий

Стабильный префикс длиной не менее 1024 token приводит к автоматическому попаданию в кэш — совпавшая часть тарифицируется по 10% от цены входа, без платы за запись, так что уже 2-й запрос дает чистую экономию. Как писать запросы, чтобы они попадали в кэш, и как использовать prompt_cache_key: см. Руководство по тарификации кэширования промптов OpenAI.

Claude: ручные маркеры, максимальная экономия

Добавьте cache_control к блокам содержимого, которые хотите кэшировать; попадания тарифицируются по 0.1× (запись стоит 1.25× / 2×). Это особенно важно для Claude Code, Cline, Cursor и других сценариев с высокой нагрузкой. Учтите, что это работает только в нативном формате Anthropic (/v1/messages) — при вызове Claude через формат, совместимый с OpenAI, скидка за кэш не применяется. См. Руководство по тарификации кэширования промптов Claude.

Gemini: поддерживается, но ожидания лучше не завышать

APIYI автоматически включает неявное кэширование контекста для нативного формата Gemini, а попадания тарифицируются по официальной скидке Google. На практике, однако, процент попаданий в кэш у Gemini заметно ниже, чем у Claude / OpenAI (поведение неявного кэширования на стороне upstream не поддается управлению). Наша рекомендация:
  • Рассматривайте скидку за кэш как приятный бонус — оценивайте затраты по цене без кэша
  • Для нагрузок, чувствительных к кэшу, с длинными и часто повторяющимися префиксами, отдавайте предпочтение каналам OpenAI или Claude

Другие каналы: DeepSeek / Qwen / Grok

Кэширование на этих каналах полностью автоматическое (маркеры не нужны), нормально работает через APIYI и на практике показывает хорошие результаты: Повышение доли попаданий работает так же, как и с OpenAI: сначала стабильный контент, затем изменчивый — не размещайте временные метки и случайные ID в начале prompt. Подход из руководства «Тарификация кэша OpenAI» применим напрямую.

Как подтвердить попадание

Проверьте поля кэша в ответе usage: Значение выше 0 означает попадание. В журналах вызовов на панели управления использование из кэша отображается отдельными позициями со скидкой, которые вы можете проверить напрямую.

На что обратить внимание

Кэширование следует формату вызова: при вызове моделей Claude через формат, совместимый с OpenAI (/v1/chat/completions), вы не получите скидку на кэш Claude — для интенсивного использования Claude применяйте нативный формат /v1/messages.
  • Кэши изолированы для каждой модели: при переключении моделей (даже в пределах одной серии) ничего не используется совместно
  • Для вендоров, не перечисленных выше (Kimi и т. д.), ориентируйтесь на поля кэша, которые фактически возвращаются в ваших логах вызовов
  • Подробности официального механизма: platform.openai.com/docs/guides/prompt-caching, docs.claude.com/en/docs/build-with-claude/prompt-caching, ai.google.dev/gemini-api/docs/caching, api-docs.deepseek.com/quick_start/pricing, docs.x.ai/developers/advanced-api-usage/prompt-caching

Связанные документы

Руководство по тарификации кэширования OpenAI

Автоматическое кэширование: порог в 1024 token, попадания со скидкой 90%, маршрутизация по prompt_cache_key

Руководство по тарификации кэширования Claude

Где размещать cache_control, математика точки безубыточности, техники многоходового диалога

Множители моделей

Как коэффициенты группы консоли преобразуются в цены в USD

Журналы вызовов

Просматривайте использование token по каждому запросу и сведения о тарификации кэша

Свяжитесь с нами

Поддержка WeCom

QR-код поддержки WeComОтсканируйте, чтобы добавить, или свяжитесь с поддержкойВопросы по тарификации кэша и техническая поддержка

Электронная почта

Поддержка: [email protected]Бизнес: [email protected]