Valumigo

GPT-6.1 Sol

OpenAI · 2026-09-29

基本情報

開発元
OOpenAI
リリース日
2026-09-29
総合能力指数(ECI)
未測定

公式動画

OpenAI DevDay 2026 Keynote (FULL) · OpenAI

ベンチマークスコア(Epoch AI)

各ベンチマークで評価されたモデルの中での順位も表示します。

O博士レベルの科学問題(GPQA Diamond) · 30モデル中3位
95.4%
O最高難度の数学(FrontierMath) · 30モデル中1位
93.7%
O事実に関する質問の正答率(SimpleQA Verified) · 30モデル中2位
73.9%

棒は正答率(%)を示し、0%から描画しています。

ユーザー投票ランキング(LMArena)

ユーザーが2つのモデルの回答を比較し、投票した結果に基づく順位です。投票数がまだ不足しているランキングには掲載されません。

  • 総合413モデル中21位 · 1483
  • エージェントのタスク成功50モデル中2位 · 0.155
  • Web開発50モデル中4位 · 1758
  • エージェント総合50モデル中5位 · 0.112
  • コーディング408モデル中8位 · 1542
  • 画像理解(ビジョン)50モデル中10位 · 1291
  • 英語413モデル中13位 · 1496
  • 創作411モデル中27位 · 1460
  • 中国語389モデル中59位 · 1500

利用できるサービス

OpenAIのモデルは主にChatGPTで利用できます。料金プランによって利用できるモデルと使用量が異なるため、料金・無料利用範囲のページでご確認ください。

ChatGPTの料金・無料利用範囲を見る →

実測レポート

第1回の課題が簡単すぎたという指摘を受け、小さなECサイトのコードで、複数ファイルにまたがるバグ、仕様に基づく機能、並行処理のバグに取り組ませました。18回の実行記録と課題ファイルを公開します。

Claude Code vs Codex 第2回:複数ファイルの実務型課題3つを各3回試しました
スコアと順位は公開資料からそのまま転載したものであり、当サイトが独自に測定した値ではありません。資料によってモデル名が多少異なるため、自動照合した結果には、まれに別のバージョンのデータが混在する場合があります。

出典: Epoch AI (CC BY 4.0) · 確認日 2026-10-04 · LMArena (CC BY 4.0) · 確認日 2026-10-04