SimpleQA
SimpleQA est un benchmark de factualité créé par OpenAI. Il évalue la capacité des grands modèles de langage à fournir des réponses courtes et exactes à des questions factuelles ouvertes, conçues pour admettre une réponse unique et incontestable.
SimpleQA est un benchmark de factualité créé par OpenAI. Il évalue la capacité des grands modèles de langage à fournir des réponses courtes et exactes à des questions factuelles ouvertes, conçues pour admettre une réponse unique et incontestable.
Les questions couvrent des domaines variés, des sciences et technologies au divertissement. Au-delà de l’exactitude, SimpleQA examine aussi la calibration des modèles, notamment leur aptitude à reconnaître leur incertitude ou à s’abstenir lorsque nécessaire. Il sert ainsi à comparer la fiabilité factuelle des réponses synthétiques.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | factualité, généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 4 326 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (45)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 97,1 % | 29 septembre 2025 | Auto-déclaré |
| 2 | Grok 4 Fast | xAI | 🔒 Propriétaire | 95,0 % | 28 août 2025 | Auto-déclaré |
| 3 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 93,4 % | 10 janvier 2025 | Auto-déclaré |
| 4 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 92,3 % | 28 mai 2025 | Auto-déclaré |
| 5 | ERNIE 5.0 | Baidu | 🔒 Propriétaire | 75,0 % | 22 janvier 2026 | Auto-déclaré |
| 6 | Gemini 3 Pro | 🔒 Propriétaire | 72,1 % | 18 novembre 2025 | Auto-déclaré | |
| 7 | Gemini 3 Flash | 🔒 Propriétaire | 68,7 % | 17 décembre 2025 | Auto-déclaré | |
| 8 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 62,5 % | 5 mars 2026 | Auto-déclaré |
| 9 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 57,9 % | 23 avril 2026 | Auto-déclaré |
| 10 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,4 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,3 % | 22 juillet 2025 | Auto-déclaré |
| 12 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 54,0 % | 5 juin 2025 | Auto-déclaré | |
| 13 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,9 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Gemini 2.5 Pro | 🔒 Propriétaire | 50,8 % | 20 mai 2025 | Auto-déclaré | |
| 15 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,6 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,0 % | 22 septembre 2025 | Auto-déclaré |
| 17 | o1 | OpenAI | 🔒 Propriétaire | 47,0 % | 17 décembre 2024 | Auto-déclaré |
| 18 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,4 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 43,3 % | 3 mars 2026 | Auto-déclaré | |
| 20 | o1-preview | OpenAI | 🔒 Propriétaire | 42,4 % | 12 septembre 2024 | Auto-déclaré |
| 21 | GPT-4o | OpenAI | 🔒 Propriétaire | 38,2 % | 27 mars 2025 | Auto-déclaré |
| 22 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 35,3 % | 11 juillet 2025 | Auto-déclaré |
| 23 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 34,1 % | 23 avril 2026 | Auto-déclaré |
| 24 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 31,0 % | 11 juillet 2025 | Auto-déclaré |
| 25 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 31,0 % | 5 septembre 2025 | Auto-déclaré |
| 26 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 27,0 % | 22 septembre 2025 | Auto-déclaré |
| 27 | Gemini 2.5 Flash | 🔒 Propriétaire | 26,9 % | 20 mai 2025 | Auto-déclaré | |
| 28 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 24,9 % | 25 décembre 2024 | Auto-déclaré |
| 29 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 23,9 % | 22 septembre 2025 | Auto-déclaré |
| 30 | Mistral Large 3 (675B Base) | Mistral AI | 🟢 Ouvert | 23,8 % | 4 décembre 2025 | Auto-déclaré |
| 31 | Mistral Large 3 (675B Instruct 2512 Eagle) | Mistral AI | 🟢 Ouvert | 23,8 % | 4 décembre 2025 | Auto-déclaré |
| 32 | Mistral Large 3 (675B Instruct 2512 NVFP4) | Mistral AI | 🟢 Ouvert | 23,8 % | 4 décembre 2025 | Auto-déclaré |
| 33 | Mistral Large 3 (675B Instruct 2512) | Mistral AI | 🟢 Ouvert | 23,8 % | 4 décembre 2025 | Auto-déclaré |
| 34 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 21,7 % | 5 février 2025 | Auto-déclaré | |
| 35 | MiniMax M1 | MiniMax | 🟢 Ouvert | 17,9 % | 17 juin 2025 | Auto-déclaré |
| 36 | o3-mini | OpenAI | 🔒 Propriétaire | 15,0 % | 30 janvier 2025 | Auto-déclaré |
| 37 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 12,1 % | 20 juin 2025 | Auto-déclaré |
| 38 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 10,7 % | 17 juin 2025 | Auto-déclaré | |
| 39 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 10,4 % | 17 mars 2025 | Auto-déclaré |
| 40 | Gemma 3 27B | 🟢 Ouvert | 10,0 % | 12 mars 2025 | Auto-déclaré | |
| 41 | Gemma 3 12B | 🟢 Ouvert | 6,3 % | 12 mars 2025 | Auto-déclaré | |
| 42 | Gemma 3 4B | 🟢 Ouvert | 4,0 % | 12 mars 2025 | Auto-déclaré | |
| 43 | Phi 4 | Microsoft | 🟢 Ouvert | 3,0 % | 12 décembre 2024 | Auto-déclaré |
| 44 | Gemma 3 1B | 🟢 Ouvert | 2,2 % | 12 mars 2025 | Auto-déclaré | |
| 45 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 1,8 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 45 modèles évalués, dont 31 de grands éditeurs. Score médian de l'ensemble : 34,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur SimpleQA indique qu’un modèle répond correctement à une grande proportion de questions factuelles précises, dans un format court. Il reflète également, dans la conception du benchmark, la capacité à distinguer les connaissances maîtrisées des situations appelant une abstention ou l’expression d’une incertitude. La lecture du classement demande toutefois de la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.
Le meilleur résultat, obtenu par DeepSeek-V3.2-Exp avec 97 %, contraste fortement avec la médiane de 34 % observée parmi les 45 modèles évalués. Cet écart révèle une forte dispersion des performances. Un résultat proche du maximum peut aussi signaler un risque de saturation, qui réduit progressivement le pouvoir discriminant du benchmark au sommet. Son accès public expose par ailleurs les évaluations à un risque de contamination des données d’entraînement. Enfin, sa portée reste centrée sur des questions courtes en anglais et sur l’exactitude factuelle, sans représenter l’ensemble des capacités d’un modèle.
Sources des scores : llm-stats.