Perplexity API 料金とモデルカタログ:ユースケースガイド
Perplexity はリアルタイム Web 検索を組み合わせた検索拡張生成(Search-Augmented Generation)に特化した唯一の主要 LLM API プロバイダーです。すべての Sonar レスポンスには実際の Web 検索からのインライン引用が付きます。適切な Sonar ティアを選択して過剰支払いを防ぐ方法を解説します。プロバイダー横断比較はプロバイダー料金比較をご覧ください。
料金データはカタログから取得しています。出典と鮮度はデータソースをご確認ください。
検索拡張生成 — Perplexity が異なる理由
従来の LLM プロバイダーとは異なり、Perplexity の Sonar モデルは言語生成とリアルタイム Web 検索を組み合わせています。すべての API 呼び出しは関連する Web ページを取得し、回答を統合し、ソース URL 付きのインライン引用を返します。Web ベースの Q&A に必要な RAG パイプラインの自作が不要になります。
Perplexity はまた、ツール使用機能(Web 検索、URL 取得、People Search、Finance Search)とサンドボックス実行環境を備えたAgent APIも提供しています。これにより、単純な質問応答を超えるマルチステップリサーチワークフローに適しています。
カタログには Perplexity のルーティングレイヤー経由でアクセスできるサードパーティモデル(Anthropic Claude、OpenAI GPT、Google Gemini、xAI Grok バリエーション)も含まれており、すべて Web 検索が有効です。
Perplexity Sonar モデルティア一覧
表示価格は現在のカタログからの 1M トークンあたりです。購入決定前に Perplexity でご確認ください。
| ティア | モデル | 入力 (1M あたり) | 出力 (1M あたり) | 推奨用途 |
|---|---|---|---|---|
| Budget | Sonar Small, Llama 3.1 8B, Mistral 7B | $0.07 – $0.20 | $0.20 – $0.28 | 高ボリューム分類、簡単な Q&A |
| Standard | Sonar, Sonar Medium | $0.60 – $1.00 | $1.00 – $1.80 | 汎用検索拡張チャット、引用 |
| Pro | Sonar Pro, Sonar Reasoning Pro | $2.00 – $3.00 | $8.00 – $15.00 | マルチステップリサーチ、検索付き複雑推論 |
| Deep Research | Sonar Deep Research | $2.00 | $8.00 | 引用・推論トークンを含む徹底的分析 |
リクエスト単位料金: Sonar モデルは検索コンテキストの深さ(low/medium/high)に基づくリクエスト単位の検索料金も別途請求します。これはトークンコストに加算されます。現在のリクエスト料金は公式料金ページをご確認ください。
Sonar ワークロードのコスト例
sonar-small-online を使った場合の概算です。実際のコストはモデルの選択、検索コンテキストの深さ、リクエスト単位料金によって異なります。正確な見積もりは計算機をご利用ください。
ワークロード別のモデル選択
検索拡張チャット
引用付きの汎用 Q&A にはベースの Sonar モデルを使用します。検索対応モデルの中で最も低いトークン単価で、ソース URL 付きの根拠のある回答を提供します。
マルチステップリサーチ
複数の検索クエリと統合が必要な複雑なリサーチには、Sonar Pro または Sonar Reasoning Pro を使用します。リクエスト単位のコストが高くても、より深い検索コンテキストで相殺されます。
徹底的分析
広範な引用と推論が必要な包括的レポートには、Sonar Deep Research が引用・推論・検索クエリに追加のトークン料金を課します。
埋め込みとベクトル検索
Perplexity の pplx-embed モデルは競争力のある埋め込み料金を提供しています。0.6B モデルは $0.004/1M トークンで、利用可能な最も安い埋め込みオプションの一つです。
Perplexity API コストを削減する方法
- 適切な Sonar ティアを選択する: ベースの Sonar モデルはほとんどの検索拡張 Q&A タスクを処理します。マルチステップ推論や包括的引用が本当に必要なクエリにのみ Sonar Pro と Deep Research を使用してください。モデルルーティングカスケードのフレームワークをご覧ください。
- 検索コンテキストの深さを最小限にする: Sonar のリクエスト料金は検索コンテキストのサイズ(low/medium/high)によって異なります。単純な事実クエリには low ティアで十分で、リクエストあたりのコストも安くなります。
- 分類には Budget モデルを使用する: 検索拡張なしでクエリを分類またはルーティングするだけの場合、Sonar の代わりに $0.07–$0.20/1M 入力トークンの Llama や Mistral モデルを使用してください。
- 埋め込みジョブをバッチ処理する: Perplexity の埋め込みモデルはトークン単位で料金が設定されており、リクエスト単位のオーバーヘッドはありません。大量のバッチで文書を処理して固定コストを分散します。埋め込みコストガイドをご覧ください。
- 複雑なワークフローには Agent API を検討する: Agent API のプリセットティア(fast, low, medium, high)はモデル、ツール、サンドボックスコストをバンドルしています。マルチツールワークフローには、個別の API 呼び出しを組み合わせるよりプリセットの方が安くなる場合があります。
Perplexity の料金モデルの仕組み
| 項目 | Sonar API | Agent API |
|---|---|---|
| トークン料金 | 入力/出力トークン 1M あたり | 入力/出力トークン 1M あたり |
| 検索料金 | 検索深さ別のリクエスト単位料金 (low/medium/high) | ツール呼び出し単位料金 (web_search, fetch_url など) |
| サンドボックス | 該当なし | $0.03/セッション + $0.0025/検索 |
| キャッシュ料金 | Sonar モデルで利用可能 | Agent API モデルで利用可能 |
| 埋め込み | 1M トークンあたり ($0.004: 0.6B、$0.03: 4B) | |
カタログ内の全 Perplexity モデル
| モデル | モード | 入力 (1M あたり) | 出力 (1M あたり) | コンテキスト |
|---|---|---|---|---|
| pplx-embed-v1-0.6b | embedding | $0.0040 / 1M tokens | — | 33k |
| pplx-embed-v1-4b | embedding | $0.0300 / 1M tokens | — | 33k |
| pplx-7b-online | chat | — | $0.2800 / 1M tokens | 4k |
| sonar-small-online | chat | — | $0.2800 / 1M tokens | 12k |
| mistral-7b-instruct | chat | $0.0700 / 1M tokens | $0.2800 / 1M tokens | 4k |
| mixtral-8x7b-instruct | chat | $0.0700 / 1M tokens | $0.2800 / 1M tokens | 4k |
| pplx-7b-chat | chat | $0.0700 / 1M tokens | $0.2800 / 1M tokens | 8k |
| sonar-small-chat | chat | $0.0700 / 1M tokens | $0.2800 / 1M tokens | 16k |
| llama-3.1-8b-instruct | chat | $0.2000 / 1M tokens | $0.2000 / 1M tokens | 131k |
| codellama-34b-instruct | chat | $0.3500 / 1M tokens | $1.4000 / 1M tokens | 16k |
| sonar-medium-online | chat | — | $1.8000 / 1M tokens | 12k |
| llama-3.1-70b-instruct | chat | $1.0000 / 1M tokens | $1.0000 / 1M tokens | 131k |
| sonar | chat | $1.0000 / 1M tokens | $1.0000 / 1M tokens | 128k |
| sonar-medium-chat | chat | $0.6000 / 1M tokens | $1.8000 / 1M tokens | 16k |
| pplx-70b-online | chat | — | $2.8000 / 1M tokens | 4k |
| codellama-70b-instruct | chat | $0.7000 / 1M tokens | $2.8000 / 1M tokens | 16k |
| llama-2-70b-chat | chat | $0.7000 / 1M tokens | $2.8000 / 1M tokens | 4k |
| pplx-70b-chat | chat | $0.7000 / 1M tokens | $2.8000 / 1M tokens | 4k |
| sonar-reasoning | chat | $1.0000 / 1M tokens | $5.0000 / 1M tokens | 128k |
| sonar-deep-research | chat | $2.0000 / 1M tokens | $8.0000 / 1M tokens | 128k |
22 件中 20 件を表示中。 全 Perplexity モデルを表示。
よくある質問
Perplexity は検索料金を別途請求しますか?
はい。Sonar モデルはトークンコストに加えて、リクエスト単位の検索料金を課します。料金は検索コンテキストの深さ(low, medium, high)によって異なります。Agent API は web_search、fetch_url、その他のツールに対して呼び出し単位の料金を課します。
Sonar と Sonar Pro の違いは?
Sonar は検索付きの単純な Q&A 向けに最適化されています。Sonar Pro はより深い検索コンテキストと高品質の統合でマルチステップクエリを処理しますが、トークン単価もリクエスト単価も高くなります。
Perplexity はキャッシュ済み入力料金を提供していますか?
はい。Sonar と Agent API の両モデルがキャッシュ料金をサポートしています。キャッシュ済み入力トークンは標準入力料金の割安な料金で請求され、繰り返しプレフィックスを持つプロンプトのコストを削減します。
検索なしで Perplexity モデルを使用できますか?
カタログ内の一部モデル(Llama、Mistral、CodeLlama)は検索拡張なしの標準チャットモデルとして利用可能です。Sonar モデルは常に Web 検索を含みます。
自作 RAG と比較してどうですか?
Perplexity の Sonar モデルは、検索インフラの構築、ベクトルストアの管理、引用抽出の手間を排除します。Web ベースの Q&A では、自作 RAG パイプラインよりシンプルで安くなる場合があります。RAG アプリケーションガイドで比較をご覧ください。
Perplexity が提供する埋め込みモデルは?
2 つのモデルがあります:pplx-embed-v1-0.6b(1024 次元、$0.004/1M トークン)と pplx-embed-v1-4b(2560 次元、$0.03/1M トークン)。どちらも 32k コンテキストウィンドウをサポートしています。