Краткий ответ
Да. Все каналы APIYI Claude, OpenAI, Gemini, DeepSeek, Qwen и Grok поддерживают тарификацию кэша: параметры запросов, связанные с кэшем, передаются вверх по цепочке без изменений, поля cache-hit возвращаются без изменений, а в панели тарификации использование кэша отображается отдельными позициями по официальным дисконтным ставкам — в вашем коде не требуется никакой специфической для middleware адаптации. Попадания в кэш у Claude и OpenAI стабильны и надежны (у обоих есть отдельные руководства на этом сайте — ссылки ниже). DeepSeek, Qwen и Grok тоже работают хорошо. Неявное кэширование Gemini поддерживается, но его процент попаданий посредственный — не закладывайте кэширование Gemini в основу расчета бюджета.Три канала вкратце
Примечания по каналу
OpenAI: полностью автоматически, без усилий
Стабильный префикс длиной не менее 1024 token приводит к автоматическому попаданию в кэш — совпавшая часть тарифицируется по 10% от цены входа, без платы за запись, так что уже 2-й запрос дает чистую экономию. Как писать запросы, чтобы они попадали в кэш, и как использоватьprompt_cache_key: см. Руководство по тарификации кэширования промптов OpenAI.
Claude: ручные маркеры, максимальная экономия
Добавьтеcache_control к блокам содержимого, которые хотите кэшировать; попадания тарифицируются по 0.1× (запись стоит 1.25× / 2×). Это особенно важно для Claude Code, Cline, Cursor и других сценариев с высокой нагрузкой. Учтите, что это работает только в нативном формате Anthropic (/v1/messages) — при вызове Claude через формат, совместимый с OpenAI, скидка за кэш не применяется. См. Руководство по тарификации кэширования промптов Claude.
Gemini: поддерживается, но ожидания лучше не завышать
APIYI автоматически включает неявное кэширование контекста для нативного формата Gemini, а попадания тарифицируются по официальной скидке Google. На практике, однако, процент попаданий в кэш у Gemini заметно ниже, чем у Claude / OpenAI (поведение неявного кэширования на стороне upstream не поддается управлению). Наша рекомендация:- Рассматривайте скидку за кэш как приятный бонус — оценивайте затраты по цене без кэша
- Для нагрузок, чувствительных к кэшу, с длинными и часто повторяющимися префиксами, отдавайте предпочтение каналам OpenAI или Claude
Другие каналы: DeepSeek / Qwen / Grok
Кэширование на этих каналах полностью автоматическое (маркеры не нужны), нормально работает через APIYI и на практике показывает хорошие результаты:
Повышение доли попаданий работает так же, как и с OpenAI: сначала стабильный контент, затем изменчивый — не размещайте временные метки и случайные ID в начале prompt. Подход из руководства «Тарификация кэша OpenAI» применим напрямую.
Как подтвердить попадание
Проверьте поля кэша в ответеusage:
Значение выше 0 означает попадание. В журналах вызовов на панели управления использование из кэша отображается отдельными позициями со скидкой, которые вы можете проверить напрямую.
На что обратить внимание
- Кэши изолированы для каждой модели: при переключении моделей (даже в пределах одной серии) ничего не используется совместно
- Для вендоров, не перечисленных выше (Kimi и т. д.), ориентируйтесь на поля кэша, которые фактически возвращаются в ваших логах вызовов
- Подробности официального механизма:
platform.openai.com/docs/guides/prompt-caching,docs.claude.com/en/docs/build-with-claude/prompt-caching,ai.google.dev/gemini-api/docs/caching,api-docs.deepseek.com/quick_start/pricing,docs.x.ai/developers/advanced-api-usage/prompt-caching
Связанные документы
Руководство по тарификации кэширования OpenAI
Автоматическое кэширование: порог в 1024 token, попадания со скидкой 90%, маршрутизация по prompt_cache_key
Руководство по тарификации кэширования Claude
Где размещать cache_control, математика точки безубыточности, техники многоходового диалога
Множители моделей
Как коэффициенты группы консоли преобразуются в цены в USD
Журналы вызовов
Просматривайте использование token по каждому запросу и сведения о тарификации кэша
Свяжитесь с нами
Поддержка WeCom

Электронная почта
Поддержка: [email protected]Бизнес: [email protected]