ベンチマーク解説

推論モデルのベンチマーク解説:GPQA、AIME、MATH、コーディングスコア

公開日 2026-07-23 · 更新日 2026-07-23 · 読了目安:5 分

推論モデルはチェーン・オブ・ソートを使って複雑な問題を解決します。しかし、どのベンチマークが本当に推論能力を測定し、哪些はマーケティングに過ぎないのか?この記事で解説します。

1. 推論モデルとは?

推論モデル(OpenAI の o3、DeepSeek の R1、Qwen の Thinking バリアントなど)は、チェーン・オブ・ソートプロンプティングを使って複雑な問題を解決します。すぐに回答する代わりに、問題をステップバイステップで「思考」し、困難なタスクの精度を大幅に向上させることができます。

しかし、すべてのベンチマークが同じように作られているわけではありません。本物の推論能力を測定するものもあれば、知識の想起やパターンマッチングをテストするものもあります。知っておくべきことをまとめました。

2. 主要ベンチマーク

GPQA Diamond

大学院レベルの科学質問

推論

AIME 2024

アメリカ招待数学検定

数学

MATH-500

数学コンペティション問題

数学

LiveCodeBench

リアルタイムコーディングチャレンジ

コーディング

SWE-bench Verified

実際の GitHub issue 解決

コーディング

Aider Polyglot

多言語コード編集

コーディング

3. 推論モデルのベンチマーク比較

主要ベンチマークにおける上位推論モデルの比較です。スコアは正解率のパーセンテージ(高いほど良い)です。

モデル GPQA AIME MATH コーディング
deepseek-r1 fireworks_ai
71.5 79.8 97.3 65.9
deepseek-r1-basic fireworks_ai
71.5 79.8 97.3 65.9
deepseek-r1-671b lambda_ai
71.5 79.8 97.3 65.9
us.deepseek.r1-v1:0 bedrock_converse
71.5 79.8 97.3 65.9
deepseek-r1-turbo novita
71.5 79.8 97.3 65.9
deepseek-r1-8b llamagate
71.5 79.8 97.3 65.9
deepseek-r1-7b-qwen llamagate
71.5 79.8 97.3 65.9
qwen3-next-80b-a3b-thinking dashscope
- - - -

4. ベンチマークの見方

高スコアの意味するところ

  • GPQA Diamond:大学院レベルの本物の科学的推論
  • AIME:マルチステップ推論を要する数学的問題解決
  • MATH-500:創造的アプローチを要する数学コンペティション
  • LiveCodeBench:新鮮な問題における実世界のコーディング能力
  • SWE-bench:実際の GitHub issue に基づく実践的ソフトウェアエンジニアリング

よくある落とし穴

  • 推論モデルと非推論モデルを同じベンチマークで比較しない
  • スコアが同じバージョン/日付のものか確認する(推論モデルは急速に改善されている)
  • 複数のベンチマークを見る — 1 つの数字では全体像がわからない
  • コストを考慮する:推論トークンは高額なので、正解 1 件あたりのコストを確認する

5. 推論モデルを使うべきタイミング

推論モデルが得意なタスク:

  • 複雑な数学的証明と計算
  • マルチステップのコーディング問題とデバッグ
  • 深い理解を要する科学的分析
  • 多くの制約を持つ戦略的計画
  • 速度よりも正確性が重要なタスク

向いていないタスク:

  • 単純な Q&A やファクト検索
  • レイテンシが重要な高スループットアプリケーション
  • ステップバイステップ推論の恩恵を受けないタスク
  • 予算が限られたアプリケーション(推論トークンは高コスト)

6. よくある質問

モデルを「推論」モデルにするものは?

推論モデルは、すぐに回答する代わりにチェーン・オブ・ソートプロンプティングを使ってステップバイステップで問題を解決します。名前に「o」「r1」「thinking」が含まれることが多いです。

推論モデルは常に優れているのか?

いいえ。推論モデルは複雑なタスクに優れていますが、速度が遅く、コストが高く、単純な質問にはオーバーキルです。難しい問題の正確性が速度やコストよりも重要な場合に使いましょう。

推論モデルのベンチマークはどのくらいの頻度で変わる?

非常に速い頻度です。推論モデルは頻繁に更新され、ベンチマークスコアは各バージョンで大きく変動する可能性があります。ベンチマーク結果の日付を必ず確認してください。

料金データはカタログから取得しています。出典と鮮度はデータソースをご確認ください。

推論モデルを比較する

ベンチマークデータをもとに、推論モデルを並べて比較します。

ベンチマークデータは公式プロバイダーレポート、学術論文、独立評価から取得しています。 スコアはバージョンや評価方法論によって異なる場合があります。