General Knowledge (Baseline)

Benchable : General Knowledge (Baseline) est un benchmark créé par Benchable pour évaluer les connaissances générales des modèles d’IA. Il repose sur des questions à choix multiple en anglais, dont la difficulté progresse de sujets accessibles vers des connaissances très obscures.

Benchable : General Knowledge (Baseline) est un benchmark créé par Benchable pour évaluer les connaissances générales des modèles d’IA. Il repose sur des questions à choix multiple en anglais, dont la difficulté progresse de sujets accessibles vers des connaissances très obscures.

Son périmètre couvre notamment l’histoire, les sciences, la géographie, les arts, la littérature, l’actualité et des domaines académiques spécialisés. Il sert de test de référence pour comparer la capacité des modèles à identifier précisément une réponse correcte parmi quatre options.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesConnaissances generales (histoire, science, geographie, arts, litterature, actualite, domaines academiques specialises) du niveau facile a tres obscur
ModalitéTexte
Type de questionsQCM (4 options A/B/C/D)
Métrique d'évaluationOption correcte selectionnee (Exact Match, JSON Path $.answer)
AccèsPublic
Languesanglais
Taille du jeu200 questions
RessourcesSite / dépôt officiel

Classement des modèles (162)

#ModèleÉditeurLicenceScoreSortieFiabilité
1AionLabs: Aion-3.0Aion Labs▫ n.d.100,0 %7 juillet 2026✅ Mesuré
2AionLabs: Aion-3.0-MiniAion Labs▫ n.d.100,0 %7 juillet 2026✅ Mesuré
3ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.100,0 %26 février 2026✅ Mesuré
4Claude Opus 4Anthropic🔒 Propriétaire100,0 %22 mai 2025✅ Mesuré
5Claude Opus 4.1Anthropic🔒 Propriétaire100,0 %5 août 2025✅ Mesuré
6Claude Opus 4.5Anthropic🔒 Propriétaire100,0 %24 novembre 2025✅ Mesuré
7Claude Sonnet 4.5Anthropic🔒 Propriétaire100,0 %29 septembre 2025✅ Mesuré
8GPT-5OpenAI🔒 Propriétaire100,0 %7 août 2025✅ Mesuré
9GPT-5 miniOpenAI🔒 Propriétaire100,0 %7 août 2025✅ Mesuré
10GPT-5 nanoOpenAI🔒 Propriétaire100,0 %7 août 2025✅ Mesuré
11GPT-5.1OpenAI🔒 Propriétaire100,0 %13 novembre 2025✅ Mesuré
12GPT-5.2OpenAI🔒 Propriétaire100,0 %11 décembre 2025✅ Mesuré
13GPT-5.6 LunaOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
14GPT-5.6 SolOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
15GPT-5.6 TerraOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
16Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.100,0 %10 juillet 2026✅ Mesuré
17Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.100,0 %27 mars 2026✅ Mesuré
18Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.100,0 %10 juillet 2026✅ Mesuré
19Mistral: Mistral Medium 3Mistral AI▫ n.d.100,0 %7 mai 2025✅ Mesuré
20Mistral: Mistral Medium 3.1Mistral AI▫ n.d.100,0 %13 août 2025✅ Mesuré
21Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert100,0 %8 juin 2026✅ Mesuré
22OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire100,0 %5 mai 2026✅ Mesuré
23OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire100,0 %13 novembre 2025✅ Mesuré
24OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire100,0 %4 décembre 2025✅ Mesuré
25OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire100,0 %10 décembre 2025✅ Mesuré
26OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire100,0 %21 avril 2026✅ Mesuré
27OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
28OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
29OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
30SonarPerplexity🔒 Propriétaire100,0 %29 janvier 2025✅ Mesuré
31Sonar ProPerplexity🔒 Propriétaire100,0 %7 mars 2025✅ Mesuré
32StepFun: Step 3.7 FlashStepFun🟢 Ouvert100,0 %28 mai 2026✅ Mesuré
33Tencent: Hy3 previewTencent🟢 Ouvert100,0 %22 avril 2026✅ Mesuré
34Thinking Machines: InklingThinking Machines🟢 Ouvert100,0 %17 juillet 2026✅ Mesuré
35Z.ai: GLM 5 TurboZhipu AI▫ n.d.100,0 %15 mars 2026✅ Mesuré
36gemini-3-pro-imageGoogle▫ n.d.100,0 %✅ Mesuré
37kimi-k2.5-0127Moonshot AI▫ n.d.100,0 %✅ Mesuré
38laguna-m.1poolside▫ n.d.100,0 %✅ Mesuré
39mistral-large-2512mistralai▫ n.d.100,0 %✅ Mesuré
40qwen3-235b-a22b-04-28Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
41qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
42qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
43qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
44Claude Sonnet 4Anthropic🔒 Propriétaire99,8 %22 mai 2025✅ Mesuré
45MiniMax M1MiniMax🟢 Ouvert99,8 %17 juin 2025✅ Mesuré
46gemini-2.5-pro-preview-03-25Google▫ n.d.99,8 %✅ Mesuré
47o1OpenAI🔒 Propriétaire99,8 %17 décembre 2024✅ Mesuré
48AionLabs: Aion-2.0Aion Labs▫ n.d.99,5 %23 février 2026✅ Mesuré
49Arcee AI: Virtuoso LargeArcee AI▫ n.d.99,5 %5 mai 2025✅ Mesuré
50Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert99,5 %30 juin 2025✅ Mesuré
51DeepSeek V3.1 TerminusDeepSeek🟢 Ouvert99,5 %22 septembre 2025✅ Mesuré
52DeepSeek V4 FlashDeepSeek▫ n.d.99,5 %24 avril 2026✅ Mesuré
53GPT-4.1OpenAI🔒 Propriétaire99,5 %14 avril 2025✅ Mesuré
54GPT-4oOpenAI🔒 Propriétaire99,5 %27 mars 2025✅ Mesuré
55GPT-4o miniOpenAI🔒 Propriétaire99,5 %18 juillet 2024✅ Mesuré
56Gemini 3.1 Pro PreviewGoogle▫ n.d.99,5 %19 février 2026✅ Mesuré
57Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.99,5 %25 février 2026✅ Mesuré
58Kimi K2Moonshot AI▫ n.d.99,5 %6 novembre 2025✅ Mesuré
59Mistral Large 2407Mistral AI▫ n.d.99,5 %19 novembre 2024✅ Mesuré
60Nous: Hermes 4 405BNous Research🟢 Ouvert99,5 %26 août 2025✅ Mesuré
61Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert99,5 %28 août 2025✅ Mesuré
62Seed 1.6ByteDance Seed▫ n.d.99,5 %23 décembre 2025✅ Mesuré
63deepseek-chat-v3DeepSeek▫ n.d.99,5 %✅ Mesuré
64deepseek-chat-v3-0324DeepSeek▫ n.d.99,5 %✅ Mesuré
65deepseek-chat-v3.1DeepSeek▫ n.d.99,5 %✅ Mesuré
66gpt-5-chat-2025-08-07OpenAI🔒 Propriétaire99,5 %7 août 2025✅ Mesuré
67laguna-xs-2.1poolside▫ n.d.99,5 %✅ Mesuré
68nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert99,5 %28 octobre 2025✅ Mesuré
69qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.99,5 %8 septembre 2025✅ Mesuré
70qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.99,5 %✅ Mesuré
71qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.99,5 %✅ Mesuré
72xAI: Grok Build 0.1xAI▫ n.d.99,5 %20 mai 2026✅ Mesuré
73Writer: Palmyra X5Writer▫ n.d.99,4 %21 janvier 2026✅ Mesuré
74llama-4-maverick-17b-128e-instructMeta▫ n.d.99,2 %✅ Mesuré
75inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.99,1 %23 avril 2026✅ Mesuré
76Claude Haiku 4.5Anthropic🔒 Propriétaire99,0 %15 octobre 2025✅ Mesuré
77GPT-4.1 miniOpenAI🔒 Propriétaire99,0 %14 avril 2025✅ Mesuré
78MiniMax: MiniMax-01MiniMax🟢 Ouvert99,0 %15 janvier 2025✅ Mesuré
79gemini-3.1-flash-image-previewGoogle▫ n.d.99,0 %✅ Mesuré
80gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire99,0 %12 mars 2025✅ Mesuré
81olmo-3-32b-thinkallenai▫ n.d.99,0 %✅ Mesuré
82qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert99,0 %4 février 2026✅ Mesuré
83uncensoredvenice▫ n.d.99,0 %✅ Mesuré
84qwen3-14b-04-28Alibaba Cloud / Qwen Team▫ n.d.98,8 %✅ Mesuré
85Magnum v4 72Banthracite-org🟢 Ouvert98,5 %22 octobre 2024✅ Mesuré
86Mistral LargeMistral AI▫ n.d.98,5 %26 février 2024✅ Mesuré
87Mistral: Voxtral Small 24B 2507Mistral AI🟢 Ouvert98,5 %30 octobre 2025✅ Mesuré
88devstral-2512mistralai▫ n.d.98,5 %✅ Mesuré
89hermes-3-llama-3.1-405bnousresearch▫ n.d.98,5 %✅ Mesuré
90ministral-14b-2512mistralai▫ n.d.98,5 %✅ Mesuré
91DeepSeek V4 ProDeepSeek▫ n.d.98,5 %24 avril 2026✅ Mesuré
92Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.98,0 %13 novembre 2025✅ Mesuré
93Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire98,0 %30 octobre 2025✅ Mesuré
94mistral-small-24b-instruct-2501mistralai▫ n.d.98,0 %✅ Mesuré
95nova-pro-v1Amazon🔒 Propriétaire98,0 %✅ Mesuré
96mistral-saba-2502mistralai▫ n.d.97,8 %✅ Mesuré
97inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.97,6 %8 mai 2026✅ Mesuré
98Tencent: Hunyuan A13B InstructTencent🟢 Ouvert97,5 %8 juillet 2025✅ Mesuré
99nova-2-lite-v1Amazon🔒 Propriétaire97,5 %2 décembre 2025✅ Mesuré
100qwen3-8b-04-28Alibaba Cloud / Qwen Team▫ n.d.97,5 %✅ Mesuré
101skyfall-36b-v2thedrummer▫ n.d.97,5 %✅ Mesuré
102hermes-3-llama-3.1-70bnousresearch▫ n.d.97,2 %✅ Mesuré
103OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert97,0 %29 octobre 2025✅ Mesuré
104Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert97,0 %29 juillet 2025✅ Mesuré
105llama-4-scout-17b-16e-instructMeta▫ n.d.97,0 %✅ Mesuré
106mistral-small-2603mistralai▫ n.d.97,0 %✅ Mesuré
107Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert96,5 %1 avril 2026✅ Mesuré
108Claude 3 HaikuAnthropic🔒 Propriétaire96,5 %13 mars 2024✅ Mesuré
109Command A+Cohere🟢 Ouvert96,5 %20 mai 2026✅ Mesuré
110GPT-4.1 nanoOpenAI🔒 Propriétaire96,5 %14 avril 2025✅ Mesuré
111Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire96,5 %11 octobre 2024✅ Mesuré
112Nous: Hermes 4 70BNous Research🟢 Ouvert96,5 %26 août 2025✅ Mesuré
113Reka Flash 3Reka AI🟢 Ouvert96,0 %12 mars 2025✅ Mesuré
114gemini-3.1-flash-imageGoogle▫ n.d.96,0 %✅ Mesuré
115gpt-4o-search-preview-2025-03-11OpenAI🔒 Propriétaire96,0 %12 mars 2025✅ Mesuré
116ministral-8b-2512mistralai▫ n.d.96,0 %✅ Mesuré
117cydonia-24b-v4.1thedrummer▫ n.d.95,7 %✅ Mesuré
118Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert95,5 %17 avril 2024✅ Mesuré
119OpenAI: GPT-3.5 Turbo 16kOpenAI🔒 Propriétaire95,5 %28 août 2023✅ Mesuré
120Upstage: Solar Pro 3Upstage▫ n.d.95,5 %27 janvier 2026✅ Mesuré
121WizardLM-2 8x22BMicrosoft🟢 Ouvert95,5 %16 avril 2024✅ Mesuré
122nova-micro-v1Amazon🔒 Propriétaire95,0 %✅ Mesuré
123command-r-plus-08-2024Cohere▫ n.d.94,5 %✅ Mesuré
124ministral-3b-2512mistralai▫ n.d.94,0 %✅ Mesuré
125OpenAI: GPT-3.5 Turbo InstructOpenAI🔒 Propriétaire93,5 %28 septembre 2023✅ Mesuré
126AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert93,0 %8 août 2025✅ Mesuré
127Cohere: Command R (08-2024)Cohere🟢 Ouvert93,0 %30 août 2024✅ Mesuré
128IBM: Granite 4.1 8BIBM🟢 Ouvert93,0 %30 avril 2026✅ Mesuré
129l3.1-euryale-70bsao10k▫ n.d.93,0 %✅ Mesuré
130ui-tars-1.5-7bByteDance▫ n.d.93,0 %✅ Mesuré
131Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert92,5 %24 juin 2026✅ Mesuré
132rocinante-12bthedrummer▫ n.d.92,0 %✅ Mesuré
133granite-4.0-h-microIBM🟢 Ouvert91,4 %20 octobre 2025✅ Mesuré
134ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.90,5 %23 décembre 2025✅ Mesuré
135Inflection: Inflection 3 PiInflection🔒 Propriétaire88,5 %11 octobre 2024✅ Mesuré
136Cohere: Command R7B (12-2024)Cohere▫ n.d.87,8 %14 décembre 2024✅ Mesuré
137unslopnemo-12bthedrummer▫ n.d.87,5 %✅ Mesuré
138Mistral NeMoMistral AI▫ n.d.84,2 %18 juillet 2024✅ Mesuré
139l3.3-euryale-70b-v2.3sao10k▫ n.d.84,0 %✅ Mesuré
140Perceptron: Perceptron Mk1Perceptron▫ n.d.83,8 %12 mai 2026✅ Mesuré
141Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.81,5 %17 septembre 2025✅ Mesuré
142Relace: Relace Searchrelace▫ n.d.79,9 %8 décembre 2025✅ Mesuré
143reka-edge-2603Reka AI▫ n.d.70,0 %✅ Mesuré
144l3-lunaris-8bsao10k▫ n.d.69,0 %✅ Mesuré
145MiniMax: MiniMax M2-herMiniMax▫ n.d.65,5 %23 janvier 2026✅ Mesuré
146aion-rp-llama-3.1-8bAion Labs▫ n.d.58,5 %✅ Mesuré
147inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.52,5 %21 avril 2026✅ Mesuré
148Mistral: Codestral 2508Mistral AI▫ n.d.49,5 %1 août 2025✅ Mesuré
149Hy3Tencent🟢 Ouvert36,0 %6 juillet 2026✅ Mesuré
150Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert32,2 %31 juillet 2025✅ Mesuré
151remm-slerp-l2-13bundi95▫ n.d.0,5 %✅ Mesuré
152weavermancer▫ n.d.0,5 %✅ Mesuré
153mythomax-l2-13bgryphe▫ n.d.0,2 %✅ Mesuré
154Meta: Llama 3.2 1B InstructMeta🟢 Ouvert0,0 %25 septembre 2024✅ Mesuré
155Meta: Llama Guard 4 12BMeta🟢 Ouvert0,0 %30 avril 2025✅ Mesuré
156OpenAI: GPT-4 Turbo PreviewOpenAI🔒 Propriétaire0,0 %25 janvier 2024✅ Mesuré
157Qwen 3.5 PlusQwen▫ n.d.0,0 %16 février 2026✅ Mesuré
158Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %25 février 2026✅ Mesuré
159Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %27 avril 2026✅ Mesuré
160gpt-3.5-turbo-0613OpenAI🔒 Propriétaire0,0 %✅ Mesuré
161nova-premier-v1Amazon🔒 Propriétaire0,0 %✅ Mesuré
162qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.0,0 %2 avril 2026✅ Mesuré

Classement établi sur 162 modèles évalués, dont 69 de grands éditeurs. Score médian de l'ensemble : 99,0 %.

Notre analyse

Un score élevé indique qu’un modèle sélectionne très fréquemment l’option attendue dans ce format de QCM. La validation par Exact Match sur le champ JSON $.answer rend la notation stricte et reproductible, sans appréciation subjective de la formulation. Les scores étant au moins partiellement mesurés par un tiers, ils bénéficient d’une base de vérification externe plutôt que de reposer uniquement sur des déclarations des fournisseurs.

Le score médian de 99 % parmi 255 modèles et le résultat de 100 % obtenu par AionLabs: Aion-3.0 montrent toutefois une forte saturation. Le classement distingue donc difficilement les modèles les plus performants, quelques réponses seulement pouvant séparer des résultats presque identiques. Le caractère public du jeu invite aussi à considérer un risque de contamination lors de l’interprétation. Enfin, ce benchmark mesure avant tout la restitution de connaissances générales en anglais dans un cadre fermé à quatre choix. Un excellent résultat ne suffit donc pas à établir des performances équivalentes sur des tâches ouvertes ou sur d’autres capacités. Le classement révèle surtout une maîtrise désormais très élevée de ce format par une large partie des modèles évalués.


Sources des scores : benchable.