Valumigo

Epoch AI · Exactitude des réponses factuelles (SimpleQA Verified)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : SimpleQA Verified évalue l’exactitude des réponses à de courtes questions factuelles. Cette évaluation de 1,000 questions, créée par Google DeepMind et Google Research à partir de SimpleQA d’OpenAI, réduit notamment les doublons et les erreurs dans les réponses de référence.

Comment lire le score : La valeur affichée par Epoch est le pourcentage (%) de questions ayant reçu une réponse correcte. Elle diffère du F1 de l’évaluation officielle de Google. Ce score seul ne permet pas d’évaluer entièrement les hallucinations ou la tendance à refuser de répondre.

Points à surveiller : Les réponses reposent sur les connaissances internes du modèle, sans outil de recherche. Les résultats peuvent donc différer de l’exactitude d’un service avec recherche activée. Epoch utilise une consigne supplémentaire pour réduire les refus de réponse.

Ce que révèle ce classement

  • Le meilleur score est de 75.6%, obtenu par GPT-6 Astra.
  • L’écart entre la 1re et la 5e place est de 4.8%p.
  • Parmi les 10 premiers, les modèles de Google sont les plus nombreux, avec 4 modèles.
  • Les résultats de ce test sont publics pour 30 modèles.

Exactitude des réponses factuelles (SimpleQA Verified) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

OGPT-6 Astra
75.6%
OGPT-6.1 Sol
73.9%
GoogleGemini 3.1 Pro Preview
73.5%
AnthropicClaude Opus 5.5
72.2%
AnthropicClaude Fable 5.1
70.8%
AnthropicClaude Fable 5
70.7%
GoogleGemini 3.8 Flash
69.7%
OGPT-5.6 Sol
69.7%
GoogleGemini 3.7 Flash
69.2%
GoogleGemini 3 Flash Preview
66.8%
GoogleGemini 3.5 Flash
66.2%
GoogleGemini 3.6 Flash
66.2%
OGPT-5.5
63.0%
OGPT-6 Sol
60.7%
MetaMuse Spark 1.2
60.3%
AnthropicClaude Opus 5
59.9%
MetaMuse Spark 1.1
57.8%
xGrok 4.7
56.0%
AlibabaQwen3.7 Max
55.8%
AnthropicClaude Opus 4.8
53.0%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 30)
RangModèleDéveloppeurDate de sortieScore
1#1OGPT-6 Astra(max)OpenAI2026-09-0375.6%
2#2OGPT-6.1 Sol(max)OpenAI2026-09-2973.9%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1973.5%
4#4AnthropicClaude Opus 5.5(max)Anthropic2026-09-2272.2%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0170.8%
6#6AnthropicClaude Fable 5(xhigh)Anthropic2026-06-0970.7%
7#7GoogleGemini 3.8 Flash(high)Google2026-09-0269.7%
8#8OGPT-5.6 Sol(max)OpenAI2026-07-0969.7%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1369.2%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1766.8%
11#11GoogleGemini 3.5 FlashGoogle2026-05-1966.2%
12#12GoogleGemini 3.6 FlashGoogle2026-07-2166.2%
13#13OGPT-5.5(xhigh)OpenAI2026-04-2363.0%
14#14OGPT-6 Sol(max)OpenAI2026-09-2260.7%
15#15MetaMuse Spark 1.2(xhigh)Meta2026-08-0560.3%
16#16AnthropicClaude Opus 5(max)Anthropic2026-07-2459.9%
17#17MetaMuse Spark 1.1Meta2026-07-0957.8%
18#18xGrok 4.7(xhigh)xAI2026-09-2156.0%
19#19AlibabaQwen3.7 MaxAlibaba2026-05-1955.8%
20#20AnthropicClaude Opus 4.8Anthropic2026-05-2853.0%
21#21DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1352.9%
22#22AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2052.0%
23#23AnthropicClaude Opus 4.7(xhigh)Anthropic2026-04-1651.7%
24#24Moonshot AIKimi K3(max)Moonshot AI2026-07-1650.6%
25#25OGPT-5(high)OpenAI2025-08-0750.1%
26#26Oo3(high)OpenAI2025-04-1649.4%
27#27xGrok 4.6(high)xAI2026-08-1249.3%
28#28AlibabaQwen3-Max-InstructAlibaba2025-09-2448.7%
29#29xGrok 4.5(high)xAI2026-07-0848.3%
30#30OGPT-5.1(high)OpenAI2025-11-1348.0%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings