#1 nebius
Qwen2.5-Coder-7B
この条件での推定月額 API コストは $0.36 です。 掲載コンテキスト上限は 32.8K です。
モデル詳細を開くデータから見る記事
RAG の API コストは、ユーザーの質問よりも検索で渡す文脈量に左右されやすくなります。 このページでは条件を 1 つに絞り、質問 100 token、検索文脈 2,000 token、回答 500 token、月間 10,000 件で見積もります。
シナリオ
数値は、このサイトの現在の価格データから生成しています。請求額は、キャッシュ、割引、リージョン、利用量ティア、提供元ごとの課金ルールによって変わる場合があります。
短いユーザー質問を想定します。
回答の根拠として毎回モデルに渡すテキストです。
生成される回答の長さです。
月間の RAG 質問数として見積もります。
コスト確認
表は月間 API コスト見積もりの安い順です。少なくとも 2.1K の掲載コンテキスト上限がある価格付きチャットルートだけを表示します。
| モデル | コンテキスト | 入力 / 100万token | 出力 / 100万token | 月額コスト |
|---|---|---|---|---|
| Qwen2.5-Coder-7B nebius | 32.8K | $0.0100 / 1M tokens | $0.0300 / 1M tokens | $0.36 |
| llama3.2-11b-vision-instruct lambda_ai | 131.1K | $0.0150 / 1M tokens | $0.0250 / 1M tokens | $0.44 |
| llama3.2-3b-instruct lambda_ai | 131.1K | $0.0150 / 1M tokens | $0.0250 / 1M tokens | $0.44 |
| Llama-3.2-3B-Instruct deepinfra | 131.1K | $0.0200 / 1M tokens | $0.0200 / 1M tokens | $0.52 |
| paddleocr-vl novita | 16.4K | $0.0200 / 1M tokens | $0.0200 / 1M tokens | $0.52 |
| Meta-Llama-3.1-8B-Instruct-Turbo deepinfra | 131.1K | $0.0200 / 1M tokens | $0.0300 / 1M tokens | $0.57 |
| Mistral-Nemo-Instruct-2407 deepinfra | 131.1K | $0.0200 / 1M tokens | $0.0400 / 1M tokens | $0.62 |
| gpt-oss-20b Darkbloom | 32.8K | $0.0145 / 1M tokens | $0.0700 / 1M tokens | $0.65 |
RAG の最安候補は、検索で渡す文脈が短い passage か、長い document bundle かで変わります。 RAG 計算機で質問、文脈、回答、月間件数を変えてから、候補ルートを比較してください。
注意点
このページは検索品質、回答の根拠付け、引用の挙動、レイテンシ、安全性の挙動、レート制限、プロンプトキャッシュ、割引、リージョン別料金、提供元ごとの追加料金を順位付けしません。 コスト優先の候補リストとして使い、自分の検索結果パッセージで試したうえで、最終的な料金は提供元でも確認してください。