エージェント AI
コンテキスト蓄積、ツール呼び出し、繰り返し推論ループを含むマルチステップエージェントワークフローの費用を比較します。
最も重要なポイント
エージェント AI ワークロードには独自のコストドライバーがあります。コンテキストはステップを経て蓄積し、ツール呼び出しは入出力オーバーヘッドを追加し、キャッシュヒット率は合計コストに大きく影響します。低い入力価格と良いキャッシュサポートが最も重要です。
基本例
このページは6,000入力トークン(蓄積コンテキスト)、3,000出力トークン(ツール呼び出し+最終応答)、月間3,000エージェントセッションを前提としています。
基本例での低コストエージェント AI モデル
これらの行はサーバーでレンダリングされるため、スクリプト実行前に検索エンジンが読み取ることができます。
| モデル | 入力 | 出力 | 月間コスト |
|---|---|---|---|
| titan-embed-text-v2 | $0.0200 / 1M tokens | N/A | $0.36 |
| Qwen2.5-Coder-3B-Instruct | $0.0100 / 1M tokens | $0.0300 / 1M tokens | $0.45 |
| Qwen2.5-Coder-7B-Instruct | $0.0100 / 1M tokens | $0.0300 / 1M tokens | $0.45 |
| Qwen2.5-Coder-7B | $0.0100 / 1M tokens | $0.0300 / 1M tokens | $0.45 |
| llama3.2-11b-vision-instruct | $0.0150 / 1M tokens | $0.0250 / 1M tokens | $0.49 |
| llama3.2-3b-instruct | $0.0150 / 1M tokens | $0.0250 / 1M tokens | $0.49 |
| Llama-3.2-3B-Instruct | $0.0200 / 1M tokens | $0.0200 / 1M tokens | $0.54 |
| paddleocr-vl | $0.0200 / 1M tokens | $0.0200 / 1M tokens | $0.54 |
推奨されるより安価なモデル
| モデル | セッションあたりコスト | 月間コスト |
|---|---|---|
| titan-embed-text-v2 | $0.000120 | $0.36 |
| Qwen2.5-Coder-3B-Instruct | $0.000150 | $0.45 |
| Qwen2.5-Coder-7B-Instruct | $0.000150 | $0.45 |
| Qwen2.5-Coder-7B | $0.000150 | $0.45 |
| llama3.2-11b-vision-instruct | $0.000165 | $0.49 |
| llama3.2-3b-instruct | $0.000165 | $0.49 |
| Llama-3.2-3B-Instruct | $0.000180 | $0.54 |
| paddleocr-vl | $0.000180 | $0.54 |
Open calculator to estimate your own workload cost with different token counts and model choices.
Browse providers to compare models from OpenAI, Anthropic, Google, Mistral, and other providers.
Pricing data from catalog last generated 2026/08/10. Verify before production decisions. Data sources.