LLM ファインチューニングコスト比較:トレーニング・推論料金
公開日 2026-08-01 · 更新日 2026-08-01
LLM を自社データでファインチューニングすると、トレーニングトークン、推論マークアップ、オプションのホスティング費用という3つのコストレイヤーが追加されます。このガイドでは各プロバイダーの正確な料金を比較し、開始前の総コストを見積もる方法を解説します。
クイック比較:トレーニングコスト(100万トークンあたり)
トレーニングコストはモデルサイズと手法によって大きく異なります。LoRA(Low-Rank Adaptation)はフルファインチューニングより安価ですが、複雑なタスクでは品質が低下する可能性があります。
| プロバイダー | 手法 | 小 (≤16B) | 中 (17-70B) | 大 (70B+) |
|---|---|---|---|---|
| Together AI | LoRA SFT | $0.48 | $1.50 | $2.90 |
| Together AI | フル SFT | $1.20 | $3.75 | $7.25 |
| Fireworks AI | LoRA SFT | $1.00 | $6.00 | $12.00 |
| Fireworks AI | フル SFT | $2.00 | $12.00 | $24.00 |
| OpenAI | 教師あり | $1.50 (nano) | $5.00 (mini) | $25.00 (4o/4.1) |
| AWS Bedrock | マネージド | $1.49 (Llama 13B) | $7.99 (Llama 70B) | 営業に問い合わせ |
すべて米ドル/100万トレーニングトークン。LoRA = Low-Rank Adaptation。SFT = Supervised Fine-Tuning。DPO = Direct Preference Optimization(通常 SFT の 10-20% 高価)。
推論コスト:ファインチューニング済み vs ベースモデル
トレーニング後、ファインチューニング済みモデルの実行コストはベースモデルより高くなる傾向があります。プロバイダーによってはベース料金の2-3倍を課す場合もあれば、同じ料金の場合もあります。
| プロバイダー | 推論マークアップ | 例 |
|---|---|---|
| Fireworks AI | ベースと同じ | Llama 3.1 70B: $0.90/1M(ファインチューニング済みも同じ) |
| Together AI | 専用エンドポイント | トークンではなく時間単位で課金 |
| OpenAI | ベースの2-3倍 | GPT-4o: $3.75 → $15.00/1M(4倍) |
| AWS Bedrock | 時間課金 | $23.50/時間(プロビジョンドスループット) |
重要な知見:Fireworks AI の「ベースと同じ」推論料金は、プロダクションのファインチューニング済みワークロードで最もコスト効率が良いです。Together AI の専用エンドポイントは、予測可能な料金が重要な高ボリュームユースケースに適しています。
OpenAI ファインチューニング:終了中
OpenAI のファインチューニングプラットフォームは新規ユーザー向けに終了処理中です。既存のファインチューニング済みモデルは引き続き利用可能ですが、新しいファインチューニングジョブは制限されています。現在 OpenAI ファインチューニングを使用している場合は、Together AI または Fireworks AI への移行を計画してください。
| モデル | トレーニング | 推論(入力) | 推論(出力) |
|---|---|---|---|
| GPT-4.1 | $25.00/1M | $3.00/1M | $12.00/1M |
| GPT-4.1 mini | $5.00/1M | $0.80/1M | $3.20/1M |
| GPT-4.1 nano | $1.50/1M | $0.20/1M | $0.80/1M |
| GPT-4o | $25.00/1M | $3.75/1M | $15.00/1M |
| GPT-4o mini | $3.00/1M | $0.30/1M | $1.20/1M |
OpenAI はモデル改善のためのデータ共有を有効にすると、推論コストが50%割引されます。
Together AI:最も柔軟な料金体系
Together AI はモデルサイズ別の段階料金で最も幅広いファインチューニングオプションを提供しています。LoRA SFT は16B以下のモデルで100万トークンあたり$0.48から開始します。
| モデル | LoRA SFT | LoRA DPO | フル SFT | 最低料金 |
|---|---|---|---|---|
| Llama 4 Scout | $3.00/1M | $7.50/1M | 問い合わせ | $6.00 |
| Llama 4 Maverick | $8.00/1M | $20.00/1M | 問い合わせ | $16.00 |
| DeepSeek-R1 | $10.00/1M | $25.00/1M | 問い合わせ | $20.00 |
| Qwen3-235B | $6.00/1M | $15.00/1M | 問い合わせ | なし |
最低料金:1ジョブあたり$4.00。DPO(Direct Preference Optimization)は通常 SFT より10-20%高価ですが、人間の好みに合わせたモデルを生成できます。
Fireworks AI:プロダクションに最適
Fireworks AI はファインチューニング済みモデルの推論料金をベースモデルと同じにしています。これはプロダクションワークロードで一貫した料金が必要な場合に最もコスト効率が良い選択です。
| モデルサイズ | LoRA SFT | フル SFT | 推論マークアップ |
|---|---|---|---|
| ≤16B | $1.00/1M | $2.00/1M | なし |
| 16-80B | $6.00/1M | $12.00/1M | なし |
| 80-300B | $12.00/1M | $24.00/1M | なし |
| >300B | $20.00/1M | $40.00/1M | なし |
オンデマンド GPU 料金も利用可能です:H100 は$7.00/時間、B200 は$10.00/時間、B300 は$12.00/時間。
コスト見積もり例
500k トークンのデータセットで Llama 3.1 70B を3エポックファインチューニングし、月間100k リクエストを実行する場合の総コストを概算します。
| 要素 | Together AI (LoRA) | Fireworks AI (LoRA) |
|---|---|---|
| トレーニングトークン | 500k × 3 = 1.5M | 500k × 3 = 1.5M |
| トレーニングコスト | 1.5M × $1.50/1M = $2.25 | 1.5M × $6.00/1M = $9.00 |
| 月間推論(100k リクエスト × 2k トークン) | 200M トークン(専用レート) | 200M トークン(ベースレート) |
| 月間推論コスト | 約$180(専用エンドポイント) | 約$180(ベースと同じ) |
結論:トレーニングは1回限りのコスト($2-9)です。本当のコストは継続的な推論です。プロダクションワークロードでは、低マークアップまたはゼロマークアップのプロバイダーを選択してください。
ファインチューニング vs プロンプトエンジニアリング
ファインチューニングが常に最適とは限りません。以下の要因を考慮してください:
| 要因 | プロロンプトエンジニアリング | ファインチューニング |
|---|---|---|
| セットアップコスト | ゼロ | $2-100+ トレーニング |
| 継続コスト | ベースモデルと同じ | ベースの2-4倍(OpenAI)または同じ(Fireworks) |
| 品質向上 | コンテキストウィンドウで制限 | ドメイン固有タスクで大幅に向上 |
| 反復速度 | 即時 | トレーニングランごとに数時間〜数日 |
| データ要件 | なし | 1k-100k+ サンプル |
まずプロロンプトエンジニアリングと few-shot エクザンプルから始めてください。プロンプティングでcloseできない品質ギャップが明確に測定された場合にのみファインチューニングを検討してください。
まずここから
コスト計算機で異なるモデルの月間推論コストを概算し、次にプロバイダーを比較してワークロードに最適なトレーニングと推論の料金組み合わせを見つけましょう。