SimpleQA Verified

Epoch: SimpleQA Verified est un benchmark de Google DeepMind consacré à la factualité paramétrique en forme courte. Il évalue la capacité des modèles à restituer des connaissances mémorisées dans des réponses factuelles brèves, tout en mesurant leur véracité et leur propension aux…

Epoch: SimpleQA Verified est un benchmark de Google DeepMind consacré à la factualité paramétrique en forme courte. Il évalue la capacité des modèles à restituer des connaissances mémorisées dans des réponses factuelles brèves, tout en mesurant leur véracité et leur propension aux hallucinations.

Construit à partir de SimpleQA d’OpenAI, il vise à en corriger les étiquettes bruitées, les biais thématiques et les redondances. Le dédoublonnage, l’équilibrage des thèmes et la réconciliation des sources en font un outil de comparaison ciblé pour les systèmes de questions-réponses factuelles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind
Capacités mesuréesFactualité paramétrique en forme courte : connaissances factuelles mémorisées, mesure de la véracité et des hallucinations.
ModalitéTexte
Type de questionsQuestions-réponses factuelles à forme courte (factoïdes)
Métrique d'évaluationScore F1 (et exactitude)
AccèsPublic
LicenceMIT
LanguesAnglais
Taille du jeu1 000 questions
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (26)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.77,3 %19 février 2026✅ Mesuré
2GPT-5.6 SolOpenAI🔒 Propriétaire71,6 %9 juillet 2026✅ Mesuré
3Qwen3-Max-InstructQwen▫ n.d.67,5 %24 septembre 2025✅ Mesuré
4DeepSeek V4 ProDeepSeek▫ n.d.57,0 %24 avril 2026✅ Mesuré
5Qwen 3.6 MaxQwen▫ n.d.56,9 %20 avril 2026✅ Mesuré
6Grok 4.5xAI🔒 Propriétaire53,5 %16 juillet 2026✅ Mesuré
7o3OpenAI🔒 Propriétaire53,0 %16 avril 2025✅ Mesuré
8GPT-5OpenAI🔒 Propriétaire50,6 %7 août 2025✅ Mesuré
9GPT-5.1OpenAI🔒 Propriétaire48,9 %13 novembre 2025✅ Mesuré
10OpenAI: GPT-5.4 ProOpenAI🔒 Propriétaire47,8 %5 mars 2026✅ Mesuré
11GPT-5.6 TerraOpenAI🔒 Propriétaire43,1 %9 juillet 2026✅ Mesuré
12Claude Opus 4.5Anthropic🔒 Propriétaire41,8 %24 novembre 2025✅ Mesuré
13GPT-5.6 LunaOpenAI🔒 Propriétaire41,7 %9 juillet 2026✅ Mesuré
14GPT-5.2OpenAI🔒 Propriétaire38,9 %11 décembre 2025✅ Mesuré
15Grok 4.3 BetaxAI▫ n.d.38,0 %17 avril 2026✅ Mesuré
16Grok 4.20xAI▫ n.d.35,1 %31 mars 2026✅ Mesuré
17Claude Opus 4.1Anthropic🔒 Propriétaire34,8 %5 août 2025✅ Mesuré
18Kimi K2 Thinking TurboMoonshot AI▫ n.d.31,6 %6 novembre 2025✅ Mesuré
19Qwen 3.5 PlusQwen▫ n.d.26,0 %16 février 2026✅ Mesuré
20Claude Sonnet 4.5Anthropic🔒 Propriétaire23,6 %29 septembre 2025✅ Mesuré
21Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.21,2 %27 avril 2026✅ Mesuré
22GPT-5 miniOpenAI🔒 Propriétaire21,0 %7 août 2025✅ Mesuré
23Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.19,8 %25 février 2026✅ Mesuré
24GPT-5 nanoOpenAI🔒 Propriétaire12,2 %7 août 2025✅ Mesuré
25Claude 3.5 HaikuAnthropic🔒 Propriétaire6,7 %4 novembre 2024✅ Mesuré
26Claude Haiku 4.5Anthropic🔒 Propriétaire5,9 %15 octobre 2025✅ Mesuré

Classement établi sur 26 modèles évalués, dont 23 de grands éditeurs. Score médian de l'ensemble : 40,3 %.

Notre analyse

Un score élevé sur Epoch: SimpleQA Verified indique qu’un modèle fournit fréquemment la réponse factuelle attendue, avec une bonne concordance mesurée par le score F1 et l’exactitude. La fiabilité du classement est renforcée par le fait que les résultats sont au moins partiellement mesurés par un tiers, plutôt que fondés uniquement sur des déclarations des concepteurs. Parmi les 57 modèles évalués, l’écart entre la médiane de 40 % et les 77 % de Gemini 3.1 Pro Preview montre une forte différenciation des performances et une marge de progression encore importante, ce qui ne suggère pas une saturation complète. La portée reste toutefois spécialisée : le benchmark teste des questions factoïdes courtes en anglais et ne représente pas l’ensemble des capacités de raisonnement ou de génération. Son accès public peut aussi créer un risque de contamination si les questions entrent dans des données d’entraînement. Enfin, malgré le travail de dédoublonnage et d’équilibrage, les résultats doivent être interprétés comme une mesure ciblée de connaissances factuelles mémorisées et d’hallucinations.


Sources des scores : epoch.