よくある質問
FAQ
LLM API の料金、トークン、キャッシュ、コスト最適化に関するよくある質問。
データ構築日: 2026/08/10。判断の前に各プロバイダーで確認してください。
LLM API の料金で言うトークンとは何ですか?
トークンは LLM が処理するテキストの単位です。大まかに、1 トークンは約 4 文字または英語で約 0.75 単語に相当します。入力トークンはモデルに送信するテキスト、出力トークンはモデルが生成して返すテキストです。料金は通常、100 万トークンあたりで表示されます。
なぜ出力トークンの方が入力トークンより高いのですか?
出力の生成では、トークンごとにステップバイステップで推論を実行する必要がありますが、入力の処理は並列化できます。2,076 のチャットモデルの平均では、出力トークンは入力トークンの 3.6 倍のコストがかかります。
プロンプトキャッシュとは何ですか?どうやってコストを削減しますか?
プロンプトキャッシュは、以前処理した入力トークンを保存し、再処理を不要にします。OpenAI、Anthropic、Google などのプロバイダーは、キャッシュされた入力トークンに対して最大 90% の割引を提供しています。特に、同じコンテキストが繰り返されるマルチターン会話や RAG ワークロードで効果的です。プロンプトキャッシュガイドで詳細をご確認ください。
バッチ API の料金とは何ですか?
バッチ API はジョブを非同期で送信でき、通常は標準料金の 50% 割引で利用できます。その代わりレイテンシが高くなります(結果は秒単位ではなく時間単位で返されます)。オフライン処理、データエンリッチメント、非対話型ワークロードに適しています。キャッシュとバッチ料金ガイドで詳細をご確認ください。
月間の LLM API コストはどうやって見積もりますか?
月間入力トークン数にトークンあたり入力単価をかけ、出力トークン数にトークンあたり出力単価をかけて加算し、リクエスト数をかけます。計算機で実際の料金データとワークロードプリセットを使って概算できます。比較ツールでモデルを並べて比較することもできます。
API の代わりにセルフホストすべきタイミングは?
月間 API 支出が 500〜1,000 ドルを超え、インフラを維持するエンジニアリング能力がある場合、セルフホストがコスト効率よくなります。損益分岐計算機で具体的なコストを比較できます。ローカルモデルで利用可能なオープンウェイトオプションもご確認ください。
コンテキストウィンドウとは何ですか?なぜ重要ですか?
コンテキストウィンドウは、1回のリクエストでモデルが処理できる最大トークン数です。大きなコンテキストウィンドウはより多くのテキスト、コード、データを含められますが、入力コストはコンテキスト長に比例します。例えば、128k コンテキストのリクエストは、同じトークン単価で 32k コンテキストの 4 倍のコストがかかります。コンテキストウィンドウ料金ガイドで詳細な比較をご確認ください。
推論モデルとは何ですか?なぜ高いのですか?
推論モデル(OpenAI o3、Claude thinking、DeepSeek R1 など)は、拡張思考を使って複雑な問題をステップバイステップで解決します。出力を生成する前に多くの内部トークンを生成するため、標準モデルの 2〜10 倍のコストがかかります。数学、コーディング、ロジックタスクで精度が速度よりも重要な場合に使用します。推論料金ガイドで詳細をご確認ください。
異なるプロバイダーのモデルはどう比較しますか?
比較ツールを使って 2〜3 つのモデルを並べて比較できます。料金、コンテキストウィンドウ、モダリティ、機能を比較できます。プリセットショートカットで、すべてのプロバイダーから最安のチャット、コーディング、推論モデルを見つけることができます。プロバイザーディレクトリで利用可能なプロバイダー一覧もご確認ください。
モデルルーティングカスケードとは何ですか?
モデルルーティングカスケードは、シンプルなクエリを安いモデルに、複雑なクエリをプレミアムモデルにルーティングするコスト最適化戦略です。例えば、チャットボットの 80% のメッセージをBudget モデルに、20% をプレミアムモデルにルーティングすることで、コストを 60〜90% 削減しつつ、複雑なタスクの品質を維持できます。モデルルーティングガイドで 4 層フレームワークをご確認ください。
埋め込みモデルのコストはいくらですか?
埋め込みモデルはチャットモデルより安価で、通常 100 万トークンあたり $0.02〜0.13 です。テキストを数値ベクトルに変換し、検索やリトリーブルに使用します。人気のあるオプションには OpenAI text-embedding-3-small($0.02/1M)や Cohere embed-v3($0.10/1M)があります。埋め込みユースケースでコスト例をご確認ください。
オープンウェイトモデルとローカル LLM とは何ですか?
オープンウェイトモデルは、重みが公開されており、自前のハードウェアで実行できるモデルです。人気のあるファミリーには Llama、Mistral、Qwen、DeepSeek があります。ローカルで実行すると API コストを排除できますが、GPU ハードウェアとエンジニアリングのセットアップが必要です。ローカルモデルページで利用可能なオプション、ローカル vs クラウド比較でコスト分析をご確認ください。