簡潔な回答
はい。 APIYI の Claude、OpenAI、Gemini、DeepSeek、Qwen、Grok チャネルはすべてキャッシュ課金をサポートしています。キャッシュ関連のリクエストパラメータはそのまま上流へ転送され、キャッシュヒットのフィールドは変更されずに返ってきます。また、課金ダッシュボードではキャッシュされた使用量が公式の割引率で別明細として表示されるため、コード側でミドルウェア固有の調整は不要です。 Claude と OpenAI のキャッシュヒットは安定して信頼できます(どちらもこのサイトに専用ガイドがあります。下にリンクがあります)。DeepSeek、Qwen、Grok はいずれも完全自動のプレフィックスキャッシュを使用しており、安定したプレフィックスがあれば通常どおりヒットします。ただし、Grok の上流はヒットを明示的に保証していないため、キャッシュ未使用時の価格で予算を見積もってください。Gemini の暗黙的キャッシュもサポートされていますが、ヒット率は平凡です。Gemini のキャッシュを前提にコスト予算を組まないでください。3つのチャネルを一覧で見る
チャンネルノート
OpenAI: 完全自動、手間いらず
少なくとも 1024 tokens の安定したプレフィックスを維持するとヒットが自動的に発生します。マッチした部分は 入力価格の10% で課金され、書き込み料金は不要なので、2回目のリクエストからすでに純粋な節約になります。どのようにリクエストを書けばヒットするのか、そしてprompt_cache_key の使い方は、OpenAI プロンプトキャッシュ課金ガイド をご覧ください。
Claude: 手動マーカー、最大の節約
キャッシュしたいコンテンツブロックにcache_control を追加してください。ヒット時の課金は 0.1× で、書き込みは 1.25× / 2× のコストです。Claude Code、Cline、Cursor、その他の高負荷ワークロードに必須です。これは Anthropic のネイティブフォーマット(/v1/messages)でのみ動作する ことに注意してください。OpenAI互換フォーマットで Claude を呼び出しても、キャッシュ割引は適用されません。Claude プロンプトキャッシュ課金ガイド もご覧ください。
Gemini: 対応済みですが、期待は控えめに
APIYI は Gemini のネイティブフォーマットに対して、暗黙的なコンテキストキャッシュを自動で有効化し、ヒット時の課金は Google の公式割引が適用されます。ただし実際には、Gemini のキャッシュヒット率は Claude / OpenAI より明らかに低い です(上流の暗黙的キャッシュの挙動は制御できません)。私たちのおすすめは次のとおりです。- キャッシュ割引はあれば便利なボーナスとして扱い、コストはキャッシュなしの価格で見積もる
- 長くて頻繁に繰り返すプレフィックスがある、キャッシュに敏感なワークロードでは、OpenAI または Claude のチャネルを優先する
その他のチャネル: DeepSeek / Qwen / Grok
これらのチャネルでのキャッシングは 完全自動 で、(マーカーは不要です)、APIYI 経由でも通常どおり動作し、実運用でも良好です。
ヒット率を高める方法は OpenAI の場合と同じです。安定した内容を先に、変動しやすい内容を最後に 配置してください。タイムスタンプやランダム ID は prompt の先頭に置かないでください。OpenAI Cache Billing Guide にある「stable prefix」の手順をそのまま適用できます。
ヒットの確認方法
レスポンスusage のキャッシュフィールドを確認します:
0より大きい値はヒットを意味します。ダッシュボードの呼び出しログでは、キャッシュ済みの使用分が割引された個別の明細として表示され、直接確認できます。
注意事項
- キャッシュはモデルごとに分離されています: モデルを切り替えても(同じシリーズ内であっても)何も共有されません
- 上記に記載のないベンダー(Kimi など)については、呼び出しログに実際に返ってきたキャッシュフィールドに従ってください
- 公式メカニズムの詳細:
platform.openai.com/docs/guides/prompt-caching,docs.claude.com/en/docs/build-with-claude/prompt-caching,ai.google.dev/gemini-api/docs/caching,api-docs.deepseek.com/quick_start/pricing,docs.x.ai/developers/advanced-api-usage/prompt-caching
関連ドキュメント
OpenAI キャッシュ課金ガイド
自動キャッシュ: 1024-token のしきい値、ヒット時90%オフ、prompt_cache_key ルーティング
Grok キャッシュ課金ガイド
ヒット時75%オフ、128-token ブロック粒度、そして長い会話にどの エンドポイント が適しているか
Gemini キャッシュ課金ガイド
暗黙的なキャッシュのしきい値と、期待すべき内容
Claude キャッシュ課金ガイド
cache_control をどこに置くか、損益分岐点の計算、マルチターンのテクニック
モデル倍率
コンソールのグループ倍率が USD 価格にどう換算されるか
コールログ
リクエストごとの token 使用量とキャッシュ課金の詳細を確認する
お問い合わせ
WeComサポート
メール
サポート: [email protected]営業: [email protected]
