Skip to main content

簡潔な回答

はい。 APIYI の Claude、OpenAI、Gemini、DeepSeek、Qwen、Grok の各チャンネルはすべてキャッシュ課金をサポートしています。キャッシュ関連のリクエストパラメータはそのまま上流に転送され、キャッシュヒットのフィールドは変更されずに返ってきます。また、課金ダッシュボードではキャッシュ利用分が公式の割引率で別行として表示されるため、コード側でミドルウェア固有の調整は不要です。 Claude と OpenAI のキャッシュヒットは安定していて信頼性が高いです(このサイトには両方とも専用ガイドがあり、下にリンクがあります)。DeepSeek、Qwen、Grok も問題なく動作します。Gemini の暗黙的キャッシュもサポートされていますが、ヒット率は平凡です。Gemini のキャッシュを前提にコスト予算を組まないでください。

3つのチャネルを一覧で見る

チャンネルノート

OpenAI: 完全自動、手間いらず

少なくとも 1024 tokens の安定したプレフィックスを維持するとヒットが自動的に発生します。マッチした部分は 入力価格の10% で課金され、書き込み料金は不要なので、2回目のリクエストからすでに純粋な節約になります。どのようにリクエストを書けばヒットするのか、そして prompt_cache_key の使い方は、OpenAI プロンプトキャッシュ課金ガイド をご覧ください。

Claude: 手動マーカー、最大の節約

キャッシュしたいコンテンツブロックに cache_control を追加してください。ヒット時の課金は 0.1× で、書き込みは 1.25× / 2× のコストです。Claude Code、Cline、Cursor、その他の高負荷ワークロードに必須です。これは Anthropic のネイティブフォーマット(/v1/messages)でのみ動作する ことに注意してください。OpenAI互換フォーマットで Claude を呼び出しても、キャッシュ割引は適用されません。Claude プロンプトキャッシュ課金ガイド もご覧ください。

Gemini: 対応済みですが、期待は控えめに

APIYI は Gemini のネイティブフォーマットに対して、暗黙的なコンテキストキャッシュを自動で有効化し、ヒット時の課金は Google の公式割引が適用されます。ただし実際には、Gemini のキャッシュヒット率は Claude / OpenAI より明らかに低い です(上流の暗黙的キャッシュの挙動は制御できません)。私たちのおすすめは次のとおりです。
  • キャッシュ割引はあれば便利なボーナスとして扱い、コストはキャッシュなしの価格で見積もる
  • 長くて頻繁に繰り返すプレフィックスがある、キャッシュに敏感なワークロードでは、OpenAI または Claude のチャネルを優先する

その他のチャネル: DeepSeek / Qwen / Grok

これらのチャネルでのキャッシュは完全に自動で(マーカーは不要です)、APIYI 経由でも通常どおり動作し、実運用でも良好です。 ヒット率を上げる方法は OpenAI の場合と同じです。安定した内容を先頭に、変動する内容を末尾に置くことで、タイムスタンプやランダム ID を prompt の冒頭に入れないようにします。OpenAI キャッシュ課金ガイド の「stable prefix」の手順をそのまま適用できます。

ヒットの確認方法

レスポンス内のキャッシュフィールド usage を確認してください: 0より大きい値であればヒットです。ダッシュボードの呼び出しログでは、キャッシュされた使用量は個別の割引済み明細として表示され、直接確認できます。

注意事項

キャッシュは呼び出し形式に従います: ClaudeモデルをOpenAI互換形式(/v1/chat/completions)で呼び出すと、Claudeのキャッシュ割引は適用されません。Claudeを大量に使う場合は、ネイティブな/v1/messages形式を使用してください。
  • キャッシュはモデルごとに分離されています: モデルを切り替えても(同じシリーズ内であっても)何も共有されません
  • 上記に記載のないベンダー(Kimi など)については、呼び出しログに実際に返ってきたキャッシュフィールドに従ってください
  • 公式メカニズムの詳細: platform.openai.com/docs/guides/prompt-caching, docs.claude.com/en/docs/build-with-claude/prompt-caching, ai.google.dev/gemini-api/docs/caching, api-docs.deepseek.com/quick_start/pricing, docs.x.ai/developers/advanced-api-usage/prompt-caching

関連ドキュメント

OpenAI キャッシュ課金ガイド

自動キャッシュ: 1024 token のしきい値、ヒット時 90% オフ、prompt_cache_key のルーティング

Claude キャッシュ課金ガイド

cache_control をどこに置くか、損益分岐点の計算、マルチターンのテクニック

モデルのレート倍率

コンソールのグループ倍率が USD 価格にどう変換されるか

コールログ

リクエストごとの token 使用量とキャッシュ課金の詳細を確認する

お問い合わせ

WeComサポート

WeComサポートのQRコードスキャンして追加するか、サポートに連絡Cacheの課金に関する質問と技術サポート

メール