Epoch AI · コンピューター画面の操作(OSWorld 2.0)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: XLANG LabのOSWorld 2.0は、実際のOSで行う長時間のデスクトップ・ウェブタスク108件で構成される評価です。元のOSWorldとは別の、より難しい試験です。
スコアの読み方: Epochの標準指標は、タスクのすべての採点チェックポイントを通過した完全成功率(%)です。一部だけを完了した部分点とは異なります。
注意点: 実行環境、ツール設定、許可されるステップ数によってスコアが変わります。Epochは標準の500ステップの予算での結果を表示するため、同じ条件かを確認してください。
今回のランキングから読み取れること
- 最高スコアはClaude Opus 5の31.4%です。
- 1位と5位の差は18.4%pです。
- 上位9モデルのうち、Anthropicのモデルが4モデルで最も多くなっています。
- この試験の結果が公開されているモデルは9件です。
コンピューター画面の操作(OSWorld 2.0) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位9件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1Claude Opus 5(max) | Anthropic | 2026-07-24 | 31.4% |
| 2 | #2OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 27.3% |
| 3 | #3Claude Opus 4.8 | Anthropic | 2026-05-28 | 20.6% |
| 4 | #4Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 18.2% |
| 5 | #5OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 13.0% |
| 6 | #6Claude Sonnet 4.6(medium) | Anthropic | 2026-02-17 | 9.3% |
| 7 | #7MiniMax-M3 | MiniMax | 2026-06-01 | 4.6% |
| 8 | #8Kimi K2.6 | Moonshot AI | 2026-04-20 | 4.6% |
| 9 | #9Qwen3.7 Plus | Alibaba | 2026-06-02 | 2.8% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings