SimpleQA

SimpleQA est un benchmark de factualité créé par OpenAI. Il évalue la capacité des grands modèles de langage à fournir des réponses courtes et exactes à des questions factuelles ouvertes, conçues pour admettre une réponse unique et incontestable.

SimpleQA est un benchmark de factualité créé par OpenAI. Il évalue la capacité des grands modèles de langage à fournir des réponses courtes et exactes à des questions factuelles ouvertes, conçues pour admettre une réponse unique et incontestable.

Les questions couvrent des domaines variés, des sciences et technologies au divertissement. Au-delà de l’exactitude, SimpleQA examine aussi la calibration des modèles, notamment leur aptitude à reconnaître leur incertitude ou à s’abstenir lorsque nécessaire. Il sert ainsi à comparer la fiabilité factuelle des réponses synthétiques.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesfactualité, généraliste, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu4 326 questions
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (45)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert97,1 %29 septembre 2025Auto-déclaré
2Grok 4 FastxAI🔒 Propriétaire95,0 %28 août 2025Auto-déclaré
3DeepSeek-V3.1DeepSeek🟢 Ouvert93,4 %10 janvier 2025Auto-déclaré
4DeepSeek-R1-0528DeepSeek🟢 Ouvert92,3 %28 mai 2025Auto-déclaré
5ERNIE 5.0Baidu🔒 Propriétaire75,0 %22 janvier 2026Auto-déclaré
6Gemini 3 ProGoogle🔒 Propriétaire72,1 %18 novembre 2025Auto-déclaré
7Gemini 3 FlashGoogle🔒 Propriétaire68,7 %17 décembre 2025Auto-déclaré
8GPT-4.5OpenAI🔒 Propriétaire62,5 %5 mars 2026Auto-déclaré
9DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert57,9 %23 avril 2026Auto-déclaré
10Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert55,4 %22 septembre 2025Auto-déclaré
11Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert54,3 %22 juillet 2025Auto-déclaré
12Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire54,0 %5 juin 2025Auto-déclaré
13Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert51,9 %22 septembre 2025Auto-déclaré
14Gemini 2.5 ProGoogle🔒 Propriétaire50,8 %20 mai 2025Auto-déclaré
15Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert49,6 %22 septembre 2025Auto-déclaré
16Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert48,0 %22 septembre 2025Auto-déclaré
17o1OpenAI🔒 Propriétaire47,0 %17 décembre 2024Auto-déclaré
18Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert44,4 %22 septembre 2025Auto-déclaré
19Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire43,3 %3 mars 2026Auto-déclaré
20o1-previewOpenAI🔒 Propriétaire42,4 %12 septembre 2024Auto-déclaré
21GPT-4oOpenAI🔒 Propriétaire38,2 %27 mars 2025Auto-déclaré
22Kimi K2 BaseMoonshot AI🟢 Ouvert35,3 %11 juillet 2025Auto-déclaré
23DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert34,1 %23 avril 2026Auto-déclaré
24Kimi K2 InstructMoonshot AI🟢 Ouvert31,0 %11 juillet 2025Auto-déclaré
25Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert31,0 %5 septembre 2025Auto-déclaré
26Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert27,0 %22 septembre 2025Auto-déclaré
27Gemini 2.5 FlashGoogle🔒 Propriétaire26,9 %20 mai 2025Auto-déclaré
28DeepSeek-V3DeepSeek🟢 Ouvert24,9 %25 décembre 2024Auto-déclaré
29Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert23,9 %22 septembre 2025Auto-déclaré
30Mistral Large 3 (675B Base)Mistral AI🟢 Ouvert23,8 %4 décembre 2025Auto-déclaré
31Mistral Large 3 (675B Instruct 2512 Eagle)Mistral AI🟢 Ouvert23,8 %4 décembre 2025Auto-déclaré
32Mistral Large 3 (675B Instruct 2512 NVFP4)Mistral AI🟢 Ouvert23,8 %4 décembre 2025Auto-déclaré
33Mistral Large 3 (675B Instruct 2512)Mistral AI🟢 Ouvert23,8 %4 décembre 2025Auto-déclaré
34Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire21,7 %5 février 2025Auto-déclaré
35MiniMax M1MiniMax🟢 Ouvert17,9 %17 juin 2025Auto-déclaré
36o3-miniOpenAI🔒 Propriétaire15,0 %30 janvier 2025Auto-déclaré
37Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert12,1 %20 juin 2025Auto-déclaré
38Gemini 2.5 Flash-LiteGoogle🟢 Ouvert10,7 %17 juin 2025Auto-déclaré
39Mistral Small 3.1 24B InstructMistral AI🟢 Ouvert10,4 %17 mars 2025Auto-déclaré
40Gemma 3 27BGoogle🟢 Ouvert10,0 %12 mars 2025Auto-déclaré
41Gemma 3 12BGoogle🟢 Ouvert6,3 %12 mars 2025Auto-déclaré
42Gemma 3 4BGoogle🟢 Ouvert4,0 %12 mars 2025Auto-déclaré
43Phi 4Microsoft🟢 Ouvert3,0 %12 décembre 2024Auto-déclaré
44Gemma 3 1BGoogle🟢 Ouvert2,2 %12 mars 2025Auto-déclaré
45ERNIE 4.5Baidu🔒 Propriétaire1,8 %25 juin 2025Auto-déclaré

Classement établi sur 45 modèles évalués, dont 31 de grands éditeurs. Score médian de l'ensemble : 34,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur SimpleQA indique qu’un modèle répond correctement à une grande proportion de questions factuelles précises, dans un format court. Il reflète également, dans la conception du benchmark, la capacité à distinguer les connaissances maîtrisées des situations appelant une abstention ou l’expression d’une incertitude. La lecture du classement demande toutefois de la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.

Le meilleur résultat, obtenu par DeepSeek-V3.2-Exp avec 97 %, contraste fortement avec la médiane de 34 % observée parmi les 45 modèles évalués. Cet écart révèle une forte dispersion des performances. Un résultat proche du maximum peut aussi signaler un risque de saturation, qui réduit progressivement le pouvoir discriminant du benchmark au sommet. Son accès public expose par ailleurs les évaluations à un risque de contamination des données d’entraînement. Enfin, sa portée reste centrée sur des questions courtes en anglais et sur l’exactitude factuelle, sans représenter l’ensemble des capacités d’un modèle.


Sources des scores : llm-stats.