記事一覧に戻る

コストガイド

プロンプトキャッシュコスト節約ガイド:LLM API 費用を 75-90% 削減

公開日: 2026-07-25 · 更新日: 2026-07-25 · 読了時間: 約 7 分

プロンプトキャッシュは、繰り返しの入力プレフィックスをプロバイダーのサーバーに保存し、キャッシュされたトークンの有効入力コストを 75-90% 削減します。このガイドでは、主要プロバイダーでキャッシュがどう動作するか、実際のモデルデータで節約額を定量化し、キャッシュヒット率を最大にするベストプラクティスを紹介します。

1. プロンプトキャッシュの仕組み

LLM API にリクエストを送信すると、プロバイダーは入力トークンを処理します。プロンプトキャッシュを使用すると、プロバイダーは入力の最初のプレフィックス(システムプロンプト、Few-shot 例、ドキュメント)をサーバーに保存します。次のリクエストが同じプレフィックスで始まる場合、プロバイダーは those トークンの再処理をスキップし、割引されたキャッシュ入力単価を適用します。

主な制約は完全プレフィックスマッチングです。キャッシュされたトークンはプロンプトの先頭に同じ順序で配置されている必要があります。システムプロンプトの変更、ドキュメントの順序変更、甚至は空白の変更でもキャッシュがヒットしなくなります。

料金構造

ほとんどのプロバイダーはキャッシュワークロードに 3 段階の料金モデルを使用しています:

  • 通常入力 — 非キャッシュ入力の通常の 1 トークンあたり単価
  • キャッシュ入力 — 割引単価(通常は通常の 10-25%)で、キャッシュがヒットしたトークンに適用
  • キャッシュ書き込み — 最初のリクエストでキャッシュをポピュレートする際に課されるオプションのプレミアム(プロバイダーによっては追加料金なし)

出力トークンはキャッシュの有無に関係なく通常の単価で請求されます。

2. プロバイダー別キャッシュ比較

キャッシュの動作と料金はプロバイダーによって異なります。主要プロバイダーの比較は以下の通りです:

プロバイダー キャッシュ割引 キャッシュ書き込み手数料 キャッシュ TTL 最小プレフィックスサイズ
OpenAI 入力の 50-90% 割引 入力と同じ(プレミアムなし) 非活動後 5-10 分 1,024 トークン(GPT-4o)、128k(o3)
Anthropic 入力の 90% 割引 入力より +25% 最低 5 分 2,048 トークン(Claude 3+)、1,024(Haiku)
Google Gemini 入力の 75-90% 割引 なし 1 分〜1 時間(設定可能) 32 トークン
DeepSeek 入力の 90% 割引 なし 約 5 分 未公表
xAI 入力の 75-90% 割引 なし 約 5 分 未公表

以下の表は、カタログ内の 39 プロバイダーでキャッシュ入力料金を持つ 982 モデルを示しています。比較ページでキャッシュ料金行を並べて確認できます。

3. キャッシュに対応しているモデル

以下の表は、各主要プロバイダーのキャッシュ入力料金に対応する代表的なモデルを示しています。全リストは比較ページで「キャッシュ入力」でフィルタリングしてください。

プロバイダー モデル 入力 $/1M キャッシュ $/1M 出力 $/1M キャッシュ節約率 コンテキスト
OpenAI gpt-4o $$2.50 $$1.25 $$10.00 50% 16,384
OpenAI gpt-4o-mini $$0.150 $$0.075 $$0.600 50% 16,384
OpenAI GPT-4.1 $$2.00 $$0.500 $$8.00 75% 32,768
OpenAI GPT-4.1 mini $$0.400 $$0.100 $$1.60 75% 32,768
OpenAI gpt-4.1-nano $$0.100 $$0.025 $$0.400 75% 32,768
OpenAI o3 $$2.00 $$0.500 $$8.00 75% 100,000
OpenAI o4-mini $$1.10 $$0.275 $$4.40 75% 100,000
Anthropic Claude Sonnet 4 $$3.00 $$0.300 $$15.00 90% 64,000
Anthropic claude-sonnet-4-5-20250929 $$3.00 $$0.300 $$15.00 90% 64,000
Anthropic claude-haiku-4-5 $$1.00 $$0.100 $$5.00 90% 64,000
Anthropic claude-3-7-sonnet-20250219 $$3.00 $$0.300 $$15.00 90% 64,000
Google Gemini 2.5 Flash $$0.300 $$0.030 $$2.50 90% 65,535
Google gemini-2.5-pro $$1.25 $$0.125 $$10.00 90% 65,535
Google gemini-2.0-flash $$0.100 $$0.025 $$0.400 75% 8,192
DeepSeek DeepSeek Chat $$0.280 $$0.028 $$0.420 90% 8,192
DeepSeek deepseek-reasoner $$0.280 $$0.028 $$0.420 90% 65,536
xAI grok-4.5 $$2.00 $$0.500 $$6.00 75% 500,000

4. 節約額の定量化例

キャッシュによる実際の節約額は、キャッシュヒット率 — 入力プレフィックスがキャッシュされたバージョンと一致するリクエストの割合 — に依存します。異なるヒット率での具体的な例を紹介します。

シナリオ: 10k 入力トークン、1k 出力トークン、月 10,000 リクエスト

これは、システムプロンプトと取得コンテキストがリクエスト間で一貫する一般的な RAG ワークロードを表します。

モデル 戦略 月間コスト キャッシュなしとの節約額
GPT-4o キャッシュなし $350.00
50% キャッシュヒット $287.50 -18%
80% キャッシュヒット $250.00 -29%
Claude Sonnet 4 キャッシュなし $450.00
50% キャッシュヒット $315.00 -30%
80% キャッシュヒット $234.00 -48%
Gemini 2.5 Flash キャッシュなし $55.00
50% キャッシュヒット $41.50 -25%
80% キャッシュヒット $33.40 -39%
DeepSeek Chat キャッシュなし $32.20
50% キャッシュヒット $19.60 -39%
80% キャッシュヒット $12.04 -63%

80% キャッシュヒット率では、プロバイダーによらず入力コストが 72-90% 削減されます。大きなシステムプロンプトや繰り返しのドキュメントコンテキストを持つワークロードでは、節約額が最も顕著です。

5. コストシナリオ:キャッシュあり vs なし

以下の 3 つのシナリオは、キャッシュが実測可能な節約をもたらす実際のワークロードをモデル化しています。すべて計算機のキャッシュリユースプリセットを起点にしています。

カスタマーサポートチャットボット

10k 入力トークン(システムプロンプト+履歴)、500 出力トークン、月 50k リクエスト、70% キャッシュヒット率

モデル キャッシュなし キャッシュあり(70% ヒット率) 月間節約額
gpt-4o (OpenAI) $1500.00 $1062.50 $437.50 節約
Claude Sonnet 4 (Anthropic) $1875.00 $930.00 $945.00 節約
Gemini 2.5 Flash (Google) $212.50 $118.00 $94.50 節約
DeepSeek Chat (DeepSeek) $150.50 $62.30 $88.20 節約

長コンテキスト付き RAG

8k 入力トークン(システム+取得ドキュメント)、1k 出力トークン、月 20k リクエスト、60% キャッシュヒット率

モデル キャッシュなし キャッシュあり(60% ヒット率) 月間節約額
gpt-4o (OpenAI) $600.00 $480.00 $120.00 節約
Claude Sonnet 4 (Anthropic) $780.00 $520.80 $259.20 節約
Gemini 2.5 Flash (Google) $98.00 $72.08 $25.92 節約
DeepSeek Chat (DeepSeek) $53.20 $29.01 $24.19 節約

エージェント型コーディングワークフロー

15k 入力トークン(コード+指示)、2k 出力トークン、月 10k リクエスト、80% キャッシュヒット率

モデル キャッシュなし キャッシュあり(80% ヒット率) 月間節約額
gpt-4o (OpenAI) $575.00 $425.00 $150.00 節約
Claude Sonnet 4 (Anthropic) $750.00 $426.00 $324.00 節約
Gemini 2.5 Flash (Google) $95.00 $62.60 $32.40 節約
DeepSeek Chat (DeepSeek) $50.40 $20.16 $30.24 節約

重要なポイント

キャッシュは出力コストを削減しません — 出力トークンは通常、入力トークンの 3-4 倍高額です。節約は入力側から完全に発生します。出力が支配的なワークロード(長文生成、推論)では、キャッシュの効果は限定的です。入力が支配的なワークロード(RAG、長いコンテキストの分類)では、キャッシュが最も高いレバレッジを持つ最適化です。

6. キャッシュ最適化のベストプラクティス

プレフィックスの安定性のためにプロンプトを構造化する

静的コンテンツ(システム指示、Few-shot 例、参照ドキュメント)をプロンプトの先頭に配置します。可変コンテンツ(ユーザークエリ、会話履歴)は末尾に配置します。これにより、リクエスト間で共有プレフィックスが最大化されます。

プレフィックスの変更を最小限にする

タイムスタンプ、セッション ID、ランダム指示など、リクエストごとに変更される動的システムプロンプトは避けてください。動的要素が必要な場合は、静的プレフィックスの前にではなく後に配置してください。

キャッシュされたプレフィックスを十分なサイズに保つ

各プロバイダーにはキャッシュの最小プレフィックスサイズがあります。OpenAI は GPT-4o モデルで少なくとも 1,024 トークンを要求します。Anthropic は Claude 3+ で 2,048 トークンを要求します。Google Gemini はたった 32 トークンからキャッシュを開始します。短いプロンプトではキャッシュのメリットが得られない場合があります。

キャッシュヒット率を監視する

OpenAI と Anthropic は使用量レスポンスでキャッシュされたトークンを報告します。この指標を追跡して、実際のヒット率を把握してください。30% 未満の場合は、キャッシュの実装オーバーヘッドがメリットを上回る可能性があります。

キャッシュ TTL を考慮する

キャッシュは非活動後数分で期限切れになります。低トラフィックアプリケーションでは、リクエスト間でキャッシュが期限切れになる場合があります。バッチ処理やスケジュールされたジョブは、リクエストがクラスター化されている場合にキャッシュのメリットを受けられます。

モデルルーティングと組み合わせる

モデルルーティングカスケードとキャッシュを併用します。シンプルなクエリを Budget モデルに、複雑なクエリを Premium モデルにルーティングします。両方のルートがキャッシュされたシステムプロンプトの恩恵を受け、節約を複合します。

7. よくある質問

プロンプトキャッシュの仕組みは?

プロンプトキャッシュは、入力トークンの最初のプレフィックスをプロバイダーのサーバーに保存します。次のリクエストが同じプレフィックスで始まる場合、プロバイダーは those トークンの再処理をスキップし、割引されたキャッシュ入力単価を適用します。プレフィックスは完全に一致する必要があります — 同じトークンが同じ順序で、プロンプトの先頭に配置されている必要があります。

プロンプトキャッシュでどれだけ節約できるか?

ほとんどのプロバイダーはキャッシュ入力トークンに対して 75-90% の割引を提供しています。例えば、Anthropic は Claude Sonnet 4 の通常 $3.00/M に対してキャッシュ入力 $0.30/M を課金します(90% 節約)。OpenAI は GPT-4o の通常 $2.50/M に対してキャッシュ $0.50/M を課金します(80% 節約)。正確な割引はプロバイダーとモデルによって異なります。

キャッシュへの書き込みコストはあるか?

一部のプロバイダーはキャッシュ書き込み手数料 — 最初のリクエストでキャッシュをポピュレートする際の通常入力料金に対するプレミアム — を課します。Anthropic はキャッシュ書き込みに $3.75/M を課金します($3.00/M 入力に対する 25% プレミアム)。OpenAI と Google は通常、別途キャッシュ書き込み手数料を課しません。DeepSeek もキャッシュ書き込み手数料を課しません。

キャッシュに対応しているモデルは?

カタログ内の 30+ プロバイダーで 1,100 以上のモデルがキャッシュ入力料金に対応しています。主要プロバイダーには OpenAI(100+ モデル)、Anthropic(23 モデル)、Google Gemini(50+ モデル)、DeepSeek(12 モデル)、xAI(38 モデル)、Mistral(Azure 経由)があります。各モデルの料金ページでキャッシュ入力行を確認してください。

プロンプトキャッシュは出力品質に影響するか?

いいえ。キャッシュされたプロンプトは非キャッシュのプロンプトと同一の出力を生成します。キャッシュは入力トークンの請求方法にのみ影響します — モデルはどちらの方法でも同じトークンを処理します。

キャッシュはどのくらい持続するか?

キャッシュの TTL はプロバイダーによって異なります。OpenAI のキャッシュは非活動後 5-10 分間持続します。Anthropic のキャッシュは少なくとも 5 分間持続します。Google Gemini のキャッシュは設定可能な TTL(1 分〜1 時間)を持ちます。キャッシュが期限切れになると、次のリクエストは通常の入力料金を課され、キャッシュを再ポピュレートします。

ストリーミングと一緒に使用できるか?

はい。プロンプトキャッシュはストリーミングと非ストリーミングの両方のレスポンスで動作します。キャッシュは出力の配信方法に関係なく入力トークンに適用されます。

プロンプトキャッシュを使用すべきでないケースは?

すべてのリクエストがユニークなプロンプト(繰り返しプレフィックスなし)の場合、入力トークンが非常に短い(1k トークン未満)場合、またはキャッシュヒット率が 20% 未満と予想される場合は、キャッシュのメリットが限定的です。これらのケースでは通常の入力料金で十分です。

キャッシュの節約額を試算する

計算機のキャッシュリユースプリセットで、正確なワークロードをシミュレートし、キャッシュによる節約額を確認できます。

価格データは当社のカタログから取得しています。出典と鮮度についてはデータソースをご確認ください。