記事一覧に戻る

プロバイダー分析

LLM API プロバイダー ベンチマーク比較:2026 年はどのプロバイダーがリードしているか?

ベンチマークスコアはモデルの能力を比較するのに役立ちますが、ワークロードによって異なる結果を示します。 このガイドでは OpenAI、Anthropic、Google、Mistral、DeepSeek のベンチマークカバレッジとトップスコアを比較します。 料金比較はプロバイダー料金比較をご覧ください。

最終更新 2026 年 7 月 23 日 5 プロバイダーを比較 カタログ生成時点のデータ

料金データはカタログから取得しています。出典と鮮度はデータソースをご確認ください。

カバレッジ

プロバイダー別のベンチマークカバレッジ

カバレッジは、各プロバイダーのモデルのうちベンチマークデータが登録されているモデルの割合を示します。カバレッジが高いほど、多くのモデルを能力で比較できます。

プロバイダー モデル数 ベンチマークあり カバレッジ
OpenAI 219 78 36%
Anthropic 24 17 71%
Google 73 20 27%
Mistral 58 21 36%
DeepSeek 12 4 33%

主要ベンチマーク

各ベンチマークが測定するもの

MMLU

Massive Multitask Language Understanding — STEM、人文、社会科学を含む 57 の学術科目の知識をテスト。

一般知識

GPQA Diamond

Graduate-level Google-Proof Q&A — 生物学、化学、物理学の博士レベル科学問題。検索で解答できないように設計。

推論

HumanEval

Docstring からのコード生成 — 自然言語の記述から正しい Python 関数を生成する能力をテスト。

コーディング

MATH

競技レベルの数学 — 複数ステップの推論を要する複雑な数学問題を解く能力をテスト。

数学

SWE-bench Verified

実践的なソフトウェアエンジニアリング — 本番コードベースの実際の GitHub Issue を修正する能力をテスト。

コーディング

MMMU

Multitask Multimodal Understanding — テキスト、画像、音声、動画の理解をテスト。

マルチモーダル

プロバイダーの強み

プロバイダー別のベンチマーク強み

OpenAI

  • 全ベンチマークで堅実な成績
  • o3 が MATH でリード(97.8%)
  • o4-mini が HumanEval でリード(97.3%)
  • GPT-5.4 が GPQA Diamond でリード(92.0%)
OpenAI モデルを見る

Anthropic

  • 高い推論能力
  • Claude Opus 4.8 が GPQA Diamond でリード(91.3%)
  • SWE-bench Verified で高スコア
  • 強いコーディング性能
Anthropic モデルを見る

Google

  • 高いマルチモーダル能力
  • Gemini 2.5 Pro が MMLU でリード(89.2%)
  • MMMU で高スコア(82.0%)
  • 競争力のある料金設定
Google モデルを見る

Mistral

  • 強いオープンソースモデル
  • Mistral Small 4 がオープンモデルで GPQA Diamond リード(71.2%)
  • Codestral がコーディングベンチマークで競争力
  • Apache 2.0 ライセンス
Mistral モデルを見る

DeepSeek

  • 高い推論能力
  • DeepSeek R1 が MATH でリード(97.3%)
  • GPQA Diamond で競争力(71.5%)
  • MIT ライセンス、完全オープンソース
DeepSeek モデルを見る

ツール

自分でモデルを比較する

関連ガイド

続きを読む

免責事項

ベンチマークスコアは、各プロバイダーの公式ドキュメントおよびサイトのモデルカタログから取得しています。評価方法(0-shot と 5-shot、プロンプトの違い)によって異なる結果が生まれます。本記事はいかなるプロバイダーとも提携していません。