Epoch AI · Rapports de recherche (DeepResearch Bench)
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Comment lire ce classement
Ce qui est mesuré : Deep Research Bench de FutureSearch, répertorié par Epoch, évalue la capacité à rechercher et à synthétiser des informations sur le web pour répondre à des questions de recherche. Il faut le distinguer d’un autre benchmark du même nom qui évalue la qualité de longs rapports.
Comment lire le score : Des scores de 0~1 sont agrégés à partir de la précision, du rappel, du F1, de l’exactitude des réponses, des erreurs d’estimation des probabilités et d’autres mesures propres à chaque tâche. Leur affichage en pourcentage ne représente pas le taux de résolution de l’ensemble des tâches.
Points à surveiller : L’évaluation utilise RetroSearch pour rechercher des documents web archivés, avec des conditions d’agent prédéfinies. Certaines notations intègrent un jugement assisté par l’IA : interprétez les petits écarts en tenant compte des conditions d’évaluation.
Ce que révèle ce classement
- Le meilleur score est de 55.3%, obtenu par Claude Opus 4.6.
- L’écart entre la 1re et la 5e place est de 2.7%p.
- Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 6 modèles.
- Les résultats de ce test sont publics pour 25 modèles.
Rapports de recherche (DeepResearch Bench) Epoch AI
Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04
Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.
Voir le tableau (top 25)
| Rang | Modèle | Développeur | Date de sortie | Score |
|---|---|---|---|---|
| 1 | #1Claude Opus 4.6(high) | Anthropic | 2026-02-05 | 55.3% |
| 2 | #2Claude Sonnet 4.6(high) | Anthropic | 2026-02-17 | 54.9% |
| 3 | #3Claude Opus 4.5(high) | Anthropic | 2025-11-24 | 54.8% |
| 4 | #4OGPT-5.5(high) | OpenAI | 2026-04-23 | 54.0% |
| 5 | #5Claude Sonnet 4.5(2k thinking) | Anthropic | 2025-09-29 | 52.6% |
| 6 | #6Claude Opus 4.8 | Anthropic | 2026-05-28 | 50.2% |
| 7 | #7Gemini 3 Flash Preview | 2025-12-17 | 49.8% | |
| 8 | #8OGPT-5(low) | OpenAI | 2025-08-07 | 49.6% |
| 9 | #9claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 48.3% |
| 10 | #10Gemini 3.1 Pro Preview | 2026-02-19 | 47.8% | |
| 11 | #11xgrok-4-0709 | xAI | 2025-07-09 | 47.3% |
| 12 | #12Claude Opus 4 | Anthropic | 2025-05-22 | 46.8% |
| 13 | #13claude-sonnet-4-20250514_2K | Anthropic | 2025-05-22 | 46.6% |
| 14 | #14Gemini 3 Pro Preview(low) | 2025-11-18 | 46.3% | |
| 15 | #15Claude Haiku 4.5(low) | Anthropic | 2025-10-15 | 45.5% |
| 16 | #16Oo3(medium) | OpenAI | 2025-04-16 | 45.2% |
| 17 | #17Claude 3.7 Sonnet(2k thinking) | Anthropic | 2025-02-24 | 43.6% |
| 18 | #18Gemini 2.5 Pro Preview(Jun 2025) | 2025-06-05 | 42.8% | |
| 19 | #19OGPT-5.1(low) | OpenAI | 2025-11-13 | 42.8% |
| 20 | #20gemini-2.5-pro | 2025-06-05 | 41.5% | |
| 21 | #21OGPT-5.2(low) | OpenAI | 2025-12-11 | 41.1% |
| 22 | #22Gemini 3.1 Flash-Lite | 2026-03-03 | 37.3% | |
| 23 | #23OGPT-5.4 mini(low) | OpenAI | 2026-03-17 | 36.3% |
| 24 | #24OGPT-5.4(low) | OpenAI | 2026-03-05 | 35.1% |
| 25 | #25DeepSeek-R1(May 2025) | DeepSeek | 2025-05-28 | 35.1% |
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings