Краткий ответ
Да. Все каналы APIYI Claude, OpenAI, Gemini, DeepSeek, Qwen и Grok поддерживают тарификацию кэша: связанные с кэшем параметры запроса передаются вверх по цепочке без изменений, поля попадания в кэш возвращаются вам без модификации, а панель тарификации показывает использование кэша отдельными строками по официальным скидочным тарифам — без необходимости какой-либо адаптации на уровне middleware в вашем коде. Попадания в кэш у Claude и OpenAI стабильны и надежны (для обоих на этом сайте есть отдельные руководства — ссылки ниже). DeepSeek, Qwen и Grok используют полностью автоматическое кэширование префикса и обычно дают попадание при стабильном префиксе — хотя восходящий сервис Grok прямо не гарантирует попадание, поэтому закладывайте в бюджет цену без кэша. Неявное кэширование Gemini поддерживается, но его коэффициент попаданий посредственный — не стройте расчет затрат на кэшировании Gemini.Три канала вкратце
Примечания по каналу
OpenAI: полностью автоматически, без усилий
Стабильный префикс длиной не менее 1024 token приводит к автоматическому попаданию в кэш — совпавшая часть тарифицируется по 10% от цены входа, без платы за запись, так что уже 2-й запрос дает чистую экономию. Как писать запросы, чтобы они попадали в кэш, и как использоватьprompt_cache_key: см. Руководство по тарификации кэширования промптов OpenAI.
Claude: ручные маркеры, максимальная экономия
Добавьтеcache_control к блокам содержимого, которые хотите кэшировать; попадания тарифицируются по 0.1× (запись стоит 1.25× / 2×). Это особенно важно для Claude Code, Cline, Cursor и других сценариев с высокой нагрузкой. Учтите, что это работает только в нативном формате Anthropic (/v1/messages) — при вызове Claude через формат, совместимый с OpenAI, скидка за кэш не применяется. См. Руководство по тарификации кэширования промптов Claude.
Gemini: поддерживается, но ожидания лучше не завышать
APIYI автоматически включает неявное кэширование контекста для нативного формата Gemini, а попадания тарифицируются по официальной скидке Google. На практике, однако, процент попаданий в кэш у Gemini заметно ниже, чем у Claude / OpenAI (поведение неявного кэширования на стороне upstream не поддается управлению). Наша рекомендация:- Рассматривайте скидку за кэш как приятный бонус — оценивайте затраты по цене без кэша
- Для нагрузок, чувствительных к кэшу, с длинными и часто повторяющимися префиксами, отдавайте предпочтение каналам OpenAI или Claude
Другие каналы: DeepSeek / Qwen / Grok
Кэширование на этих каналах полностью автоматическое (маркеры не нужны), нормально работает через APIYI и на практике показывает хорошие результаты:
Повышение уровня попаданий работает так же, как и с OpenAI: сначала стабильный контент, затем изменчивый — не размещайте метки времени и случайные IDs в начале prompt. К «стабильному префиксу» в Руководстве по тарификации кэша OpenAI это применимо напрямую.
Как подтвердить попадание в кэш
Проверьте поля кэша в ответеusage:
Значение выше 0 означает попадание в кэш. В журналах вызовов на панели управления использование кэша отображается как отдельные позиции со скидкой, которые вы можете проверить напрямую.
На что обратить внимание
- Кэши изолированы для каждой модели: при переключении моделей (даже в пределах одной серии) ничего не используется совместно
- Для вендоров, не перечисленных выше (Kimi и т. д.), ориентируйтесь на поля кэша, которые фактически возвращаются в ваших логах вызовов
- Подробности официального механизма:
platform.openai.com/docs/guides/prompt-caching,docs.claude.com/en/docs/build-with-claude/prompt-caching,ai.google.dev/gemini-api/docs/caching,api-docs.deepseek.com/quick_start/pricing,docs.x.ai/developers/advanced-api-usage/prompt-caching
Связанные документы
Руководство по тарификации кэша OpenAI
Автоматическое кэширование: порог 1024 token, попадания со скидкой 90%, маршрутизация по prompt_cache_key
Руководство по тарификации кэша Grok
Скидка 75% на попадания, гранулярность блоков 128 token и какой endpoint подходит для длинных разговоров
Руководство по тарификации кэша Gemini
Неявные пороги кэширования и чего ожидать
Руководство по тарификации кэша Claude
Где размещать cache_control, расчёт точки безубыточности, техники для многотурового взаимодействия
Коэффициенты моделей
Как коэффициенты группы в консоли преобразуются в цены в USD
Журналы вызовов
Изучите использование token по каждому запросу и детали тарификации кэша
Свяжитесь с нами
Поддержка WeCom

Электронная почта
Поддержка: [email protected]Бизнес: [email protected]