プロバイダー分析
LLM API プロバイダー ベンチマーク比較:2026 年はどのプロバイダーがリードしているか?
ベンチマークスコアはモデルの能力を比較するのに役立ちますが、ワークロードによって異なる結果を示します。 このガイドでは OpenAI、Anthropic、Google、Mistral、DeepSeek のベンチマークカバレッジとトップスコアを比較します。 料金比較はプロバイダー料金比較をご覧ください。
料金データはカタログから取得しています。出典と鮮度はデータソースをご確認ください。
カバレッジ
プロバイダー別のベンチマークカバレッジ
カバレッジは、各プロバイダーのモデルのうちベンチマークデータが登録されているモデルの割合を示します。カバレッジが高いほど、多くのモデルを能力で比較できます。
| プロバイダー | モデル数 | ベンチマークあり | カバレッジ |
|---|---|---|---|
| OpenAI | 219 | 78 | 36% |
| Anthropic | 24 | 17 | 71% |
| 73 | 20 | 27% | |
| Mistral | 58 | 21 | 36% |
| DeepSeek | 12 | 4 | 33% |
主要ベンチマーク
各ベンチマークが測定するもの
MMLU
Massive Multitask Language Understanding — STEM、人文、社会科学を含む 57 の学術科目の知識をテスト。
GPQA Diamond
Graduate-level Google-Proof Q&A — 生物学、化学、物理学の博士レベル科学問題。検索で解答できないように設計。
HumanEval
Docstring からのコード生成 — 自然言語の記述から正しい Python 関数を生成する能力をテスト。
MATH
競技レベルの数学 — 複数ステップの推論を要する複雑な数学問題を解く能力をテスト。
SWE-bench Verified
実践的なソフトウェアエンジニアリング — 本番コードベースの実際の GitHub Issue を修正する能力をテスト。
MMMU
Multitask Multimodal Understanding — テキスト、画像、音声、動画の理解をテスト。
プロバイダーの強み
プロバイダー別のベンチマーク強み
OpenAI
- 全ベンチマークで堅実な成績
- o3 が MATH でリード(97.8%)
- o4-mini が HumanEval でリード(97.3%)
- GPT-5.4 が GPQA Diamond でリード(92.0%)
Anthropic
- 高い推論能力
- Claude Opus 4.8 が GPQA Diamond でリード(91.3%)
- SWE-bench Verified で高スコア
- 強いコーディング性能
Mistral
- 強いオープンソースモデル
- Mistral Small 4 がオープンモデルで GPQA Diamond リード(71.2%)
- Codestral がコーディングベンチマークで競争力
- Apache 2.0 ライセンス
DeepSeek
- 高い推論能力
- DeepSeek R1 が MATH でリード(97.3%)
- GPQA Diamond で競争力(71.5%)
- MIT ライセンス、完全オープンソース
ツール
自分でモデルを比較する
関連ガイド
続きを読む
免責事項
ベンチマークスコアは、各プロバイダーの公式ドキュメントおよびサイトのモデルカタログから取得しています。評価方法(0-shot と 5-shot、プロンプトの違い)によって異なる結果が生まれます。本記事はいかなるプロバイダーとも提携していません。