SimpleQA Verified
Epoch: SimpleQA Verified est un benchmark de Google DeepMind consacré à la factualité paramétrique en forme courte. Il évalue la capacité des modèles à restituer des connaissances mémorisées dans des réponses factuelles brèves, tout en mesurant leur véracité et leur propension aux…
Epoch: SimpleQA Verified est un benchmark de Google DeepMind consacré à la factualité paramétrique en forme courte. Il évalue la capacité des modèles à restituer des connaissances mémorisées dans des réponses factuelles brèves, tout en mesurant leur véracité et leur propension aux hallucinations.
Construit à partir de SimpleQA d’OpenAI, il vise à en corriger les étiquettes bruitées, les biais thématiques et les redondances. Le dédoublonnage, l’équilibrage des thèmes et la réconciliation des sources en font un outil de comparaison ciblé pour les systèmes de questions-réponses factuelles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind |
| Capacités mesurées | Factualité paramétrique en forme courte : connaissances factuelles mémorisées, mesure de la véracité et des hallucinations. |
| Modalité | Texte |
| Type de questions | Questions-réponses factuelles à forme courte (factoïdes) |
| Métrique d'évaluation | Score F1 (et exactitude) |
| Accès | Public |
| Licence | MIT |
| Langues | Anglais |
| Taille du jeu | 1 000 questions |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (26)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 77,3 % | 19 février 2026 | ✅ Mesuré | |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 71,6 % | 9 juillet 2026 | ✅ Mesuré |
| 3 | Qwen3-Max-Instruct | Qwen | ▫ n.d. | 67,5 % | 24 septembre 2025 | ✅ Mesuré |
| 4 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 57,0 % | 24 avril 2026 | ✅ Mesuré |
| 5 | Qwen 3.6 Max | Qwen | ▫ n.d. | 56,9 % | 20 avril 2026 | ✅ Mesuré |
| 6 | Grok 4.5 | xAI | 🔒 Propriétaire | 53,5 % | 16 juillet 2026 | ✅ Mesuré |
| 7 | o3 | OpenAI | 🔒 Propriétaire | 53,0 % | 16 avril 2025 | ✅ Mesuré |
| 8 | GPT-5 | OpenAI | 🔒 Propriétaire | 50,6 % | 7 août 2025 | ✅ Mesuré |
| 9 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 48,9 % | 13 novembre 2025 | ✅ Mesuré |
| 10 | OpenAI: GPT-5.4 Pro | OpenAI | 🔒 Propriétaire | 47,8 % | 5 mars 2026 | ✅ Mesuré |
| 11 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 43,1 % | 9 juillet 2026 | ✅ Mesuré |
| 12 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 41,8 % | 24 novembre 2025 | ✅ Mesuré |
| 13 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 41,7 % | 9 juillet 2026 | ✅ Mesuré |
| 14 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 38,9 % | 11 décembre 2025 | ✅ Mesuré |
| 15 | Grok 4.3 Beta | xAI | ▫ n.d. | 38,0 % | 17 avril 2026 | ✅ Mesuré |
| 16 | Grok 4.20 | xAI | ▫ n.d. | 35,1 % | 31 mars 2026 | ✅ Mesuré |
| 17 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 34,8 % | 5 août 2025 | ✅ Mesuré |
| 18 | Kimi K2 Thinking Turbo | Moonshot AI | ▫ n.d. | 31,6 % | 6 novembre 2025 | ✅ Mesuré |
| 19 | Qwen 3.5 Plus | Qwen | ▫ n.d. | 26,0 % | 16 février 2026 | ✅ Mesuré |
| 20 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 23,6 % | 29 septembre 2025 | ✅ Mesuré |
| 21 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 21,2 % | 27 avril 2026 | ✅ Mesuré |
| 22 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 21,0 % | 7 août 2025 | ✅ Mesuré |
| 23 | Qwen: Qwen3.5-Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 19,8 % | 25 février 2026 | ✅ Mesuré |
| 24 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 12,2 % | 7 août 2025 | ✅ Mesuré |
| 25 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 6,7 % | 4 novembre 2024 | ✅ Mesuré |
| 26 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 5,9 % | 15 octobre 2025 | ✅ Mesuré |
Classement établi sur 26 modèles évalués, dont 23 de grands éditeurs. Score médian de l'ensemble : 40,3 %.
Notre analyse
Un score élevé sur Epoch: SimpleQA Verified indique qu’un modèle fournit fréquemment la réponse factuelle attendue, avec une bonne concordance mesurée par le score F1 et l’exactitude. La fiabilité du classement est renforcée par le fait que les résultats sont au moins partiellement mesurés par un tiers, plutôt que fondés uniquement sur des déclarations des concepteurs. Parmi les 57 modèles évalués, l’écart entre la médiane de 40 % et les 77 % de Gemini 3.1 Pro Preview montre une forte différenciation des performances et une marge de progression encore importante, ce qui ne suggère pas une saturation complète. La portée reste toutefois spécialisée : le benchmark teste des questions factoïdes courtes en anglais et ne représente pas l’ensemble des capacités de raisonnement ou de génération. Son accès public peut aussi créer un risque de contamination si les questions entrent dans des données d’entraînement. Enfin, malgré le travail de dédoublonnage et d’équilibrage, les résultats doivent être interprétés comme une mesure ciblée de connaissances factuelles mémorisées et d’hallucinations.
Sources des scores : epoch.