記事一覧に戻る

コストガイド

コンテキストウィンドウ料金ガイド:コンテキスト長に応じた入力トークンコストの変動

公開日: 2026-07-25 · 更新日: 2026-07-25 · 読了時間: 約 8 分

コンテキストが長くなれば入力トークン数が増え、コストも高くなります。しかし、コンテキスト長とコストの関係は常に線形ではありません。一部のプロバイダーはコンテキストサイズに関係なく同じ単価を設定していますが、閾値を超えると追加料金を課す場合があります。このガイドでは、コンテキスト長が料金にどう影響するか、トランケートすべきタイミング、コスト管理のベストプラクティスを解説します。

1. コンテキスト長がコストに影響する仕組み

LLM API の料金は文字数や単語数ではなく、トークン数ベースです。入力コンテキスト内のすべてのトークン — システムプロンプト、会話履歴、取得したドキュメント、Few-shot 例 — がモデルの 1 トークンあたりの入力単価に乗算されます。コンテキスト長が 2 倍になれば、リクエストあたりの入力コストも 2 倍になります。

計算式はシンプルです:

リクエストコスト = (入力トークン × 入力単価/1M) + (出力トークン × 出力単価/1M)

GPT-5($1.25/1M 入力トークン)で 10,000 トークンの入力の場合、リクエストあたりの入力コストは $0.0125 です。同じモデルで 100,000 トークンの入力になると $0.125 に — 10 倍のコスト増加で線形にスケールします。

出力トークンは通常、入力トークンの 3-6 倍高額であるため、出力コストが全体を支配することが多いです。しかし、長い入力と短い出力(分類、抽出、ロングコンテキスト要約)のワークロードでは、入力コストが主要な費用になります。

2. コンテキスト別ティア料金

一部のプロバイダーは送信する入力トークン数に応じて異なる料金を設定しています。入力が閾値を超えると 1 トークンあたりの単価が — 場合によっては大幅に — 増加します。これはモデルの基本価格とは別物です。

プロバイダー / モデル 標準入力 ロングコンテキスト入力 閾値 価格上昇
Claude Sonnet 4.5 $3.00/1M $6.00/1M 200k トークン超 2 倍
Gemini 2.5 Pro $1.25/1M $2.50/1M 200k トークン超 2 倍
Grok 4.5 $2.00/1M $4.00/1M 200k トークン超 2 倍
Grok 4.3 $1.25/1M $2.50/1M 200k トークン超 2 倍
GPT-5 / GPT-5.1 $1.25/1M $1.25/1M ティアなし なし
Gemini 2.5 Flash $0.30/1M $0.30/1M ティアなし なし
DeepSeek V3.2 $0.28/1M $0.28/1M ティアなし なし
Anthropic 出力(200k 超) $15.00/1M $22.50/1M 200k トークン超 1.5 倍

重要なポイント

OpenAI、Google Gemini Flash、DeepSeek、Mistral はロングコンテキスト入力に追加料金を課しません。100k+ トークンを regularly 送信する必要がある場合、これらのプロバイダーは Anthropic や Google Pro モデルが 200k 超で課すティアプレミアムを回避できます。

3. ショートコンテキスト vs ロングコンテキストのコスト比較

以下の表は、人気モデルのコンテキスト長ごとのリクエストあたり入力コストを比較したものです。比較のため出力は 1,000 トークンに固定しています。

モデル 入力 $/1M コンテキスト 5k トークン 20k トークン 50k トークン 100k トークン 200k トークン
GPT-4.1 Nano $0.10 32k $0.0009 $0.0024 $0.0054 $0.01
GPT-4.1 Mini $0.40 32k $0.0036 $0.0096 $0.02 $0.04
GPT-5 Mini $0.25 128k $0.0032 $0.0070 $0.01 $0.03 $0.05
GPT-5 $1.25 128k $0.02 $0.04 $0.07 $0.14 $0.26
Claude Haiku 4.5 $1.00 64k $0.01 $0.03 $0.06 $0.10 $0.20
Claude Sonnet 4.5 $3.00 64k $0.03 $0.07 $0.17 $0.32 $0.61
Gemini 2.5 Flash $0.30 65k $0.0040 $0.0085 $0.02 $0.03 $0.06
Gemini 2.5 Pro $1.25 65k $0.02 $0.04 $0.07 $0.14 $0.26
DeepSeek Chat $0.28 8k $0.0018 $0.0060 $0.01 $0.03
DeepSeek V3.2 $0.28 164k $0.0018 $0.0060 $0.01 $0.03 $0.06
Grok 3 Mini $0.30 131k $0.0020 $0.0065 $0.02 $0.03 $0.06
Grok 3 $3.00 131k $0.03 $0.07 $0.17 $0.32 $0.61

100k 入力トークンで最安のオプション:

  • DeepSeek V3.2 — リクエストあたり $0.03(164k コンテキスト、ティアプレミアムなし)
  • Gemini 2.5 Flash — リクエストあたり $0.03(65k コンテキスト、ティアプレミアムなし)
  • GPT-5 Mini — リクエストあたり $0.03(128k コンテキスト、ティアプレミアムなし)
  • Grok 3 Mini — リクエストあたり $0.03(131k コンテキスト、ティアプレミアムなし)

スケール時の月間コスト: 50k 入力トークン、1k 出力、月 10k リクエスト

モデル 月間コスト 最安との比較
DeepSeek V3.2 $144.00 ベースライン
Gemini 2.5 Flash $175.00 22%
GPT-5 Mini $145.00 1%
Grok 3 Mini $155.00 8%
GPT-4.1 Nano $54.00 -63%
GPT-5 $725.00 403%
Claude Sonnet 4.5 $1650.00 1046%

50k 入力トークンで、Claude Sonnet 4.5 は月間コストが DeepSeek V3.2 より 1046% 高くなります。ティア別料金が適用される場合、コンテキスト長がさらに長いと差はさらに広がります。

4. トランケート vs ロングコンテキストモデルの選び方

トランケートすべきケース:

  • フルコンテキストが不要な場合。200 ページのドキュメントを要約するが最初と最後の章だけが必要なら、それらだけを送信します。
  • ティアプレミアムが適用される場合。Claude Sonnet 4.5 に 210k トークンを送信すると 2 倍の入力プレミアムが発生します。190k トークンにトランケートすればティアを完全に回避できます。
  • 品質が劣化しない場合。分類、抽出、簡単な Q&A など、ノイズの多いフルドキュメントよりも焦点を絞った短いコンテキストの方が適しているタスクがあります。
  • コストが完全性よりも重要な場合。高ボリュームワークロードでは、リクエストあたりの小さな節約が複合します。100k リクエストでコンテキストの 20% をトランケートするだけで、月間数千ドルを節約できます。

ロングコンテキストモデルを使うケース:

  • フルコンテキストが必要的な場合。法的ドキュメントレビュー、コードベース分析、マルチドキュメント推論、大きな取得セットを含む RAG では、重要な情報を欠落しないためにフルコンテキストが必要です。
  • ティアプレミアムがない場合。Gemini 2.5 Flash、DeepSeek V3.2、GPT-5 Mini、Grok 3 Mini はティアなしでロングコンテキストに対応 — トークンを多く送るほど比例してコストが増加し、指数関数的に増えることはありません。
  • 品質が幅に依存する場合。複数ドキュメントの比較、矛盾の検出、大きなコーパスにまたがる質問回答など、一度にすべてを確認するメリットがあるタスク。
  • レイテンシが許容される場合。ロングコンテキストは処理時間を増加させます。レイテンシが重要でない場合は、低コストなロングコンテキストモデルでフルコンテキストを使用する方が、前処理やチャンキングよりも安価であることが多いです。

判断基準

入力が 128k トークン未満なら、ほとんどのモデルがティアプレミアムなしで処理できます。128k を超える場合は、モデルがコンテキストベースのプレミアムを課すかどうかを確認してからフルコンテキストを送信してください。200k を超える場合は、ティアプレミアムのコストとフルコンテキストを含める価値を比較してください。

5. コンテキストコスト管理のベストプラクティス

最適化前に測定する

実際のリクエストあたりのコンテキストサイズをログに記録します。多くのワークロードは、冗長なシステムプロンプト、不要な会話履歴、過剰に含められた取得ドキュメントのために、必要なトークンの 2-3 倍を送信しています。まず測定し、次に最大の問題をターゲットにします。

効率的なコンテキスト使用のためのプロンプト設計

最も重要な情報をコンテキストの最初と最後に配置します。明確なセクションマーカーを使用して、モデルが関連部分に集中できるようにします。出力品質を改善せずにトークンを無駄にする冗長な指示は避けましょう。

会話履歴を積極的に刈り込む

マルチターン会話では、最後の N ターンとシステムプロンプトだけを保持します。古いターンは現在の回答に有意義な寄与をすることが rare です。5-10 ターンのスライディングウィンドウがしばしば十分です。

取得ドキュメントをチャンク化する

RAG システムでは、フルドキュメントではなく最も関連性の高いチャンクだけを取得します。再ランキングを使用して取得チャンクのスコアリングを行い、LLM に送信します。5 つの高品質チャンク(2k トークン)を送信する方が、20 チャンク(8k トークン)を送信するよりも安価で、しばしばより効果的です。

安定したプレフィックスにプロンプトキャッシュを使用する

システムプロンプト、Few-shot 例、参照ドキュメントがリクエスト間で一貫している場合は、プロンプトキャッシュを有効にします。キャッシュされたトークンは 75-90% 低コストになるため、ロングコンテキストの送信コストを相殺できます。

ワークロードに適したコンテキストウィンドウを選ぶ

常に 10k トークンしか送信しないのに 1M コンテキストウィンドウに課金する必要はありません。GPT-4.1 Nano や Gemini 2.0 Flash のような小さくて安価なモデルが、ショートコンテキストワークロードにはよりコスト効率が高いです。ロングコンテキストモデルは本当に必要なタスクに使いましょう。

2 ステージパイプラインを検討する

非常に長いドキュメントの場合は、まず安価なモデルで関連セクションを抽出または要約し、その後にプレミアムモデルにCondensed な出力を送信して最終推論を行います。これにより、高額モデルに送信する入力トークンを削減できます。

6. よくある質問

コンテキストウィンドウが大きいほど必ずコストは高くなるのですか?

いいえ。コンテキストウィンドウのサイズと 1 トークンあたりの単価は別物です。128k コンテキストウィンドウのモデルと 16k ウィンドウのモデルが同じ単価である場合があります。ただし、一部プロバイダーは入力トークン数が閾値(例: 200k トークン)を超えると追加料金を課す場合があり、実効コストが高くなることがあります。

トランケートすべきタイミングは?

削除するトークン得出力品質への寄与が低い場合にトランケートします。例えば、200 ページのドキュメントを要約する際に最初と最後の章だけで十分なら、関連性の高い部分だけを送信します。また、モデルのティア別料金閾値を超えてプレミアムが発生する場合も、190k トークンにトランケートすることでティアを回避できます。

長いコンテキストのコストはどのように見積もりますか?

入力トークン数にモデルの 1M トークンあたりの入力単価を掛けて計算します。例えば、GPT-5($1.25/1M 入力トークン)で 50,000 トークンの入力の場合、1 リクエストあたり $0.0625 です。コンテキストがティア閾値(例: 200k 以上)を超える場合は、ロングコンテキストトークンに異なる料金が適用されるか確認してください。

コンテキスト長に基づくティア別料金を採用しているプロバイダーは?

Anthropic は Claude Sonnet 4.5 で 200k トークン超の入力に 2 倍の料金を課します。Google Gemini 2.5 Pro も 200k トークン超で入力料金を 2 倍にします。xAI Grok 4.5 も同様に 200k トークン超で 2 倍です。OpenAI はコンテキストベースのティア別料金を採用しておらず、コンテキスト長に関係なく同じ単価です。

プロンプトキャッシュでロングコンテキストのコストを相殺できますか?

はい、大幅に相殺できます。長いコンテキストに安定したプレフィックス(システムプロンプト、Few-shot 例、参照ドキュメント)がある場合、それらのトークンをキャッシュすることで入力コストを 75-90% 削減できます。これにより、全リクエストでフル価格を払うことなく大きなコンテキストを維持できます。

100k トークンのドキュメントを処理する最安の方法は?

Gemini 2.5 Flash($0.30/1M 入力)や DeepSeek V3.2($0.28/1M 入力)など、大きなコンテキストウィンドウを持つ低コストモデルを使用します。要約のみで十分な場合は、最も関連性の高いセクションにトランケートしてから送信します。繰り返し処理する場合は、プロンプトキャッシュを有効にしてコストをさらに削減します。

コンテキストコストを試算する

計算機で正確なコンテキストサイズ、リクエスト数、料金比較をシミュレートできます。

価格データは当社のカタログから取得しています。出典と鮮度についてはデータソースをご確認ください。