Skip to main content

간단 답변

그렇습니다. APIYI의 Claude, OpenAI, Gemini, DeepSeek, Qwen, Grok 채널은 모두 캐시 과금을 지원합니다. 캐시 관련 요청 매개변수는 상위로 그대로 전달되고, 캐시 적중 필드는 변경되지 않은 채 그대로 돌아오며, 과금 대시보드에는 캐시된 사용량이 공식 할인 요율로 별도 항목으로 표시됩니다. 따라서 코드에서 미들웨어별 적응은 필요하지 않습니다. Claude와 OpenAI의 캐시 적중은 안정적이고 신뢰할 수 있습니다(둘 다 이 사이트에 전용 가이드가 있으며 아래에 링크되어 있습니다). DeepSeek, Qwen, Grok도 잘 동작합니다. Gemini의 암묵적 캐싱도 지원되지만, 적중률은 보통 수준입니다 — Gemini 캐싱을 기준으로 비용 예산을 잡지 마십시오.

세 채널 한눈에 보기

채널 참고 사항

OpenAI: 완전 자동, 손이 가지 않음

최소 1024 token의 안정적인 접두사를 유지하면 적중이 자동으로 발생합니다. 일치한 부분은 **입력 가격의 10%**로 과금되며, 쓰기 수수료가 없으므로 2번째 요청부터는 이미 순수한 절감입니다. 어떤 요청이 적중하는지 작성하는 방법과 prompt_cache_key의 사용 방법은 OpenAI Prompt Caching Billing Guide를 참조하십시오.

Claude: 수동 마커, 가장 큰 절감

캐시하려는 콘텐츠 블록에 cache_control를 추가하십시오. 적중은 **0.1×**로 과금되며(쓰기 비용은 1.25× / 2×입니다). Claude Code, Cline, Cursor 및 기타 고부하 작업에 필수입니다. 이것은 Anthropic 네이티브 형식(/v1/messages)에서만 작동합니다 — OpenAI 호환 형식으로 Claude를 호출하면 캐시 할인을 받을 수 없습니다. Claude Prompt Caching Billing Guide를 참조하십시오.

Gemini: 지원되지만, 기대치는 낮게 유지하십시오

APIYI는 Gemini 네이티브 형식에 대해 암묵적 컨텍스트 캐싱을 자동으로 활성화하며, 적중은 Google의 공식 할인율로 과금됩니다. 그러나 실제로는 Gemini의 캐시 적중률이 Claude / OpenAI보다 분명히 낮습니다(상위단의 암묵적 캐싱 동작은 제어할 수 없습니다). 권장 사항은 다음과 같습니다.
  • 캐시 할인은 있으면 좋은 보너스로 취급하십시오. 비용은 캐시가 없는 가격으로 추정하십시오
  • 길고 자주 반복되는 접두사가 있는 캐시 민감 워크로드에서는 OpenAI 또는 Claude 채널을 선호하십시오

기타 채널: DeepSeek / Qwen / Grok

이들 채널의 캐싱은 완전히 자동이며(마커 불필요), APIYI를 통해 정상적으로 작동하고, 실제로도 좋은 성능을 보입니다: 적중률을 높이는 방법은 OpenAI와 동일합니다: 안정적인 콘텐츠를 먼저, 변동적인 콘텐츠를 마지막에 두십시오 — 타임스탬프와 무작위 ID는 prompt의 앞부분에서 빼십시오. OpenAI Cache Billing Guide의 “안정적인 접두사” 운영 방식이 그대로 적용됩니다.

캐시 적중 확인 방법

응답 usage의 캐시 필드를 확인합니다: 0보다 큰 값은 캐시 적중을 의미합니다. 대시보드 호출 로그에서는 캐시 사용량이 할인된 별도 항목으로 표시되며, 이를 직접 확인할 수 있습니다.

주의할 사항

캐시는 호출 형식을 따릅니다: Claude 모델을 OpenAI 호환 형식(/v1/chat/completions)으로 호출하면 Claude의 캐시 할인을 받을 수 없습니다. Claude를 많이 사용하는 경우에는 네이티브 /v1/messages 형식을 사용하십시오.
  • 캐시는 모델별로 분리됩니다: 모델을 바꾸면(같은 시리즈 안에서도) 아무것도 공유되지 않습니다
  • 위에 나열되지 않은 공급업체(Kimi 등)는 호출 로그에 실제로 반환된 캐시 필드를 기준으로 하십시오
  • 공식 메커니즘 세부 정보: platform.openai.com/docs/guides/prompt-caching, docs.claude.com/en/docs/build-with-claude/prompt-caching, ai.google.dev/gemini-api/docs/caching, api-docs.deepseek.com/quick_start/pricing, docs.x.ai/developers/advanced-api-usage/prompt-caching

관련 문서

OpenAI 캐시 과금 가이드

자동 캐싱: 1024-token 임계값, 적중 시 90% 할인, prompt_cache_key 라우팅

Claude 캐시 과금 가이드

cache_control을 어디에 배치할지, 손익분기점 계산, 멀티턴 기법

모델 요율 배수

콘솔 그룹 요율 배수가 USD 가격으로 어떻게 변환되는지

호출 로그

요청별 token 사용량과 캐시 과금 세부 정보를 확인합니다

문의하기

WeCom 지원

WeCom 지원 QR 코드추가하려면 스캔하거나 지원팀에 문의하십시오캐시 과금 문의 및 기술 지원

이메일