Epoch AI · 実務の成果物(GDPval)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: OpenAIが作成したGDPvalは、さまざまな職業の業務成果物をモデルに作成させ、分野の専門家がモデルと人間の専門家の成果物を匿名で比較する評価です。
スコアの読み方: 勝率は、モデルの成果物が人間の専門家の成果物より優れていると判断された割合(%)です。勝利+引き分け率は、同等以上と判断された割合です。現在、Epochの標準グラフは勝率を使用しています。
注意点: 専門家の判断と選定された業務に基づく評価です。業務ごとに結果が異なる場合があるため、表示指標が勝率か、勝利+引き分け率かを確認してください。
今回のランキングから読み取れること
- 最高スコアはGPT-5.2の49.7%です。
- 1位と5位の差は9.4%pです。
- 上位10モデルのうち、OpenAIのモデルが4モデルで最も多くなっています。
- この試験の結果が公開されているモデルは11件です。
実務の成果物(GDPval) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位11件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1OGPT-5.2(none) | OpenAI | 2025-12-11 | 49.7% |
| 2 | #2Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 45.5% |
| 3 | #3claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 43.6% |
| 4 | #4Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 42.5% |
| 5 | #5Gemini 3 Pro Preview | 2025-11-18 | 40.3% | |
| 6 | #6OGPT-5(medium) | OpenAI | 2025-08-07 | 34.8% |
| 7 | #7Oo3(medium) | OpenAI | 2025-04-16 | 30.8% |
| 8 | #8Oo4-mini(high) | OpenAI | 2025-04-16 | 25.3% |
| 9 | #9gemini-2.5-pro | 2025-06-05 | 23.3% | |
| 10 | #10xgrok-4-0709_high | xAI | 2025-07-09 | 21.1% |
| 11 | #11OGPT-4o(Nov 2024) | OpenAI | 2024-11-20 | 9.9% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings