Claude Opus 5
Anthropic · 2026-07-24
基本情報
- 開発元
- Anthropic
- リリース日
- 2026-07-24
- 総合能力指数(ECI)
- 162.9
ベンチマークスコア(Epoch AI)
各ベンチマークで評価されたモデルの中での順位も表示します。
博士レベルの科学問題(GPQA Diamond) · 30モデル中12位
93.9%
最高難度の数学(FrontierMath) · 30モデル中11位
85.6%
初見のパズル推論(ARC-AGI-2) · 30モデル中4位
90.4%
事実に関する質問の正答率(SimpleQA Verified) · 30モデル中16位
59.9%
コンピューター画面の操作(OSWorld 2.0) · 9モデル中1位
31.4%
棒は正答率(%)を示し、0%から描画しています。
ユーザー投票ランキング(LMArena)
ユーザーが2つのモデルの回答を比較し、投票した結果に基づく順位です。投票数がまだ不足しているランキングには掲載されません。
- 総合413モデル中4位 · 1504
- 日本語274モデル中4位 · 1506
- Web開発50モデル中1位 · 1815
- 文書理解44モデル中1位 · 1516
- 創作411モデル中2位 · 1516
- 中国語389モデル中2位 · 1571
- エージェント総合50モデル中2位 · 0.138
- 数学396モデル中3位 · 1521
- 韓国語278モデル中3位 · 1498
- エージェントのタスク成功50モデル中4位 · 0.141
- 英語413モデル中6位 · 1506
- ドイツ語307モデル中6位 · 1506
- スペイン語295モデル中10位 · 1484
- コーディング408モデル中12位 · 1538
- 画像理解(ビジョン)50モデル中14位 · 1289
- フランス語290モデル中17位 · 1506
利用できるサービス
Anthropicのモデルは主にClaudeで利用できます。料金プランによって利用できるモデルと使用量が異なるため、料金・無料利用範囲のページでご確認ください。
実測レポート
第1回の課題が簡単すぎたという指摘を受け、小さなECサイトのコードで、複数ファイルにまたがるバグ、仕様に基づく機能、並行処理のバグに取り組ませました。18回の実行記録と課題ファイルを公開します。
Claude Code vs Codex 第2回:複数ファイルの実務型課題3つを各3回試しましたスコアと順位は公開資料からそのまま転載したものであり、当サイトが独自に測定した値ではありません。資料によってモデル名が多少異なるため、自動照合した結果には、まれに別のバージョンのデータが混在する場合があります。
出典: Epoch AI (CC BY 4.0) · 確認日 2026-10-04 · LMArena (CC BY 4.0) · 確認日 2026-10-04