Reasoning (Baseline)

Benchable : Reasoning (Baseline) est un benchmark public créé par Benchable pour évaluer le raisonnement complexe des modèles d’intelligence artificielle. Il s’appuie sur des questions ouvertes couvrant notamment la logique, la reconnaissance de motifs, l’inférence déductive, le…

Benchable : Reasoning (Baseline) est un benchmark public créé par Benchable pour évaluer le raisonnement complexe des modèles d’intelligence artificielle. Il s’appuie sur des questions ouvertes couvrant notamment la logique, la reconnaissance de motifs, l’inférence déductive, le raisonnement mathématique et la résolution abstraite.

Ses tâches prennent la forme d’énigmes logiques, de suites, de cryptarithmes, de problèmes spatiaux et d’exercices de déduction. Le benchmark sert ainsi de référence de base pour comparer la capacité des modèles à produire une solution logique précise plutôt qu’une simple réponse à choix multiple.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesRaisonnement complexe : logique, reconnaissance de motifs, inference deductive, raisonnement mathematique, resolution abstraite
ModalitéTexte
Type de questionsQuestions ouvertes (enigmes logiques, suites, cryptarithmes, raisonnement spatial, deduction)
Métrique d'évaluationSolution logique precise, validation par equivalence semantique (verification par IA sur JSON Path $.answer)
AccèsPublic
Languesanglais
Taille du jeu50 questions
RessourcesSite / dépôt officiel

Classement des modèles (156)

#ModèleÉditeurLicenceScoreSortieFiabilité
1AionLabs: Aion-2.0Aion Labs▫ n.d.100,0 %23 février 2026✅ Mesuré
2Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert100,0 %1 avril 2026✅ Mesuré
3DeepSeek V4 FlashDeepSeek▫ n.d.100,0 %24 avril 2026✅ Mesuré
4DeepSeek V4 ProDeepSeek▫ n.d.100,0 %24 avril 2026✅ Mesuré
5Gemini 3.1 Pro PreviewGoogle▫ n.d.100,0 %19 février 2026✅ Mesuré
6Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.100,0 %25 février 2026✅ Mesuré
7Grok 4.5xAI🔒 Propriétaire100,0 %16 juillet 2026✅ Mesuré
8Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.100,0 %10 juillet 2026✅ Mesuré
9Seed 1.6ByteDance Seed▫ n.d.100,0 %23 décembre 2025✅ Mesuré
10gemini-3-pro-imageGoogle▫ n.d.100,0 %✅ Mesuré
11inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.100,0 %8 mai 2026✅ Mesuré
12kimi-k2.5-0127Moonshot AI▫ n.d.100,0 %✅ Mesuré
13o1OpenAI🔒 Propriétaire100,0 %17 décembre 2024✅ Mesuré
14o3OpenAI🔒 Propriétaire100,0 %16 avril 2025✅ Mesuré
15qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
16AionLabs: Aion-3.0Aion Labs▫ n.d.98,0 %7 juillet 2026✅ Mesuré
17AionLabs: Aion-3.0-MiniAion Labs▫ n.d.98,0 %7 juillet 2026✅ Mesuré
18Claude Opus 4.5Anthropic🔒 Propriétaire98,0 %24 novembre 2025✅ Mesuré
19GPT-5OpenAI🔒 Propriétaire98,0 %7 août 2025✅ Mesuré
20GPT-5.6 SolOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
21GPT-5.6 TerraOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
22OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
23OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
24Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert98,0 %28 août 2025✅ Mesuré
25Sakana: Fugu UltraSakana AI▫ n.d.98,0 %24 juin 2026✅ Mesuré
26Tencent: Hy3 previewTencent🟢 Ouvert98,0 %22 avril 2026✅ Mesuré
27gemini-3.1-flash-image-previewGoogle▫ n.d.98,0 %✅ Mesuré
28laguna-m.1poolside▫ n.d.98,0 %✅ Mesuré
29qwen3-14b-04-28Alibaba Cloud / Qwen Team▫ n.d.98,0 %✅ Mesuré
30qwen3-235b-a22b-04-28Alibaba Cloud / Qwen Team▫ n.d.98,0 %✅ Mesuré
31Thinking Machines: InklingThinking Machines🟢 Ouvert97,9 %17 juillet 2026✅ Mesuré
32ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.96,0 %26 février 2026✅ Mesuré
33GPT-5 miniOpenAI🔒 Propriétaire96,0 %7 août 2025✅ Mesuré
34GPT-5 nanoOpenAI🔒 Propriétaire96,0 %7 août 2025✅ Mesuré
35GPT-5.1OpenAI🔒 Propriétaire96,0 %13 novembre 2025✅ Mesuré
36Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert96,0 %8 juin 2026✅ Mesuré
37Tencent: Hunyuan A13B InstructTencent🟢 Ouvert96,0 %8 juillet 2025✅ Mesuré
38gemini-3.1-flash-imageGoogle▫ n.d.96,0 %✅ Mesuré
39qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.96,0 %✅ Mesuré
40qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.96,0 %✅ Mesuré
41xAI: Grok Build 0.1xAI▫ n.d.96,0 %20 mai 2026✅ Mesuré
42ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.94,0 %23 décembre 2025✅ Mesuré
43OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire94,0 %5 mai 2026✅ Mesuré
44OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire94,0 %9 juillet 2026✅ Mesuré
45OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert94,0 %29 octobre 2025✅ Mesuré
46Z.ai: GLM 5 TurboZhipu AI▫ n.d.94,0 %15 mars 2026✅ Mesuré
47nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert94,0 %28 octobre 2025✅ Mesuré
48MiniMax M1MiniMax🟢 Ouvert93,9 %17 juin 2025✅ Mesuré
49OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire93,9 %13 novembre 2025✅ Mesuré
50Claude Opus 4.1Anthropic🔒 Propriétaire92,0 %5 août 2025✅ Mesuré
51Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.92,0 %10 juillet 2026✅ Mesuré
52laguna-xs-2.1poolside▫ n.d.92,0 %✅ Mesuré
53Claude Opus 4Anthropic🔒 Propriétaire90,0 %22 mai 2025✅ Mesuré
54DeepSeek V3.1 TerminusDeepSeek🟢 Ouvert90,0 %22 septembre 2025✅ Mesuré
55GPT-5.6 LunaOpenAI🔒 Propriétaire90,0 %9 juillet 2026✅ Mesuré
56Claude Sonnet 4Anthropic🔒 Propriétaire88,0 %22 mai 2025✅ Mesuré
57Claude Sonnet 4.5Anthropic🔒 Propriétaire88,0 %29 septembre 2025✅ Mesuré
58deepseek-chat-v3-0324DeepSeek▫ n.d.88,0 %✅ Mesuré
59olmo-3-32b-thinkallenai▫ n.d.88,0 %✅ Mesuré
60qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.88,0 %✅ Mesuré
61Kimi K2Moonshot AI▫ n.d.86,0 %6 novembre 2025✅ Mesuré
62OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire86,0 %21 avril 2026✅ Mesuré
63qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.86,0 %8 septembre 2025✅ Mesuré
64GPT-4oOpenAI🔒 Propriétaire84,0 %27 mars 2025✅ Mesuré
65Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.84,0 %27 mars 2026✅ Mesuré
66qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.84,0 %✅ Mesuré
67qwen3-coder-480b-a35b-07-25Alibaba Cloud / Qwen Team▫ n.d.83,3 %✅ Mesuré
68GPT-4.1OpenAI🔒 Propriétaire82,0 %14 avril 2025✅ Mesuré
69Hy3Tencent🟢 Ouvert81,2 %6 juillet 2026✅ Mesuré
70Writer: Palmyra X5Writer▫ n.d.80,6 %21 janvier 2026✅ Mesuré
71OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire80,0 %4 décembre 2025✅ Mesuré
72deepseek-chat-v3DeepSeek▫ n.d.80,0 %✅ Mesuré
73deepseek-chat-v3.1DeepSeek▫ n.d.80,0 %✅ Mesuré
74llama-4-maverick-17b-128e-instructMeta▫ n.d.80,0 %✅ Mesuré
75mistral-large-2512mistralai▫ n.d.80,0 %✅ Mesuré
76qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert79,6 %4 février 2026✅ Mesuré
77Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.78,0 %13 novembre 2025✅ Mesuré
78OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire78,0 %10 décembre 2025✅ Mesuré
79Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert78,0 %29 juillet 2025✅ Mesuré
80Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert78,0 %31 juillet 2025✅ Mesuré
81Sonar ProPerplexity🔒 Propriétaire78,0 %7 mars 2025✅ Mesuré
82Claude Haiku 4.5Anthropic🔒 Propriétaire76,0 %15 octobre 2025✅ Mesuré
83GPT-5.2OpenAI🔒 Propriétaire76,0 %11 décembre 2025✅ Mesuré
84Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.76,0 %17 septembre 2025✅ Mesuré
85Arcee AI: Virtuoso LargeArcee AI▫ n.d.74,0 %5 mai 2025✅ Mesuré
86MiniMax: MiniMax-01MiniMax🟢 Ouvert74,0 %15 janvier 2025✅ Mesuré
87Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire74,0 %30 octobre 2025✅ Mesuré
88SonarPerplexity🔒 Propriétaire74,0 %29 janvier 2025✅ Mesuré
89mistral-small-2603mistralai▫ n.d.74,0 %✅ Mesuré
90GPT-4.1 miniOpenAI🔒 Propriétaire72,0 %14 avril 2025✅ Mesuré
91Mistral: Mistral Medium 3Mistral AI▫ n.d.72,0 %7 mai 2025✅ Mesuré
92Mistral: Mistral Medium 3.1Mistral AI▫ n.d.72,0 %13 août 2025✅ Mesuré
93Nous: Hermes 4 405BNous Research🟢 Ouvert72,0 %26 août 2025✅ Mesuré
94hermes-3-llama-3.1-405bnousresearch▫ n.d.70,0 %✅ Mesuré
95Magnum v4 72Banthracite-org🟢 Ouvert68,0 %22 octobre 2024✅ Mesuré
96nova-premier-v1Amazon🔒 Propriétaire68,0 %✅ Mesuré
97Relace: Relace Searchrelace▫ n.d.66,0 %8 décembre 2025✅ Mesuré
98gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire66,0 %12 mars 2025✅ Mesuré
99Mistral LargeMistral AI▫ n.d.64,0 %26 février 2024✅ Mesuré
100Mistral: Voxtral Small 24B 2507Mistral AI🟢 Ouvert64,0 %30 octobre 2025✅ Mesuré
101Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert62,0 %24 juin 2026✅ Mesuré
102mistral-small-24b-instruct-2501mistralai▫ n.d.62,0 %✅ Mesuré
103Command A+Cohere🟢 Ouvert60,0 %20 mai 2026✅ Mesuré
104mistral-saba-2502mistralai▫ n.d.60,0 %✅ Mesuré
105skyfall-36b-v2thedrummer▫ n.d.60,0 %✅ Mesuré
106Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire58,0 %11 octobre 2024✅ Mesuré
107Mistral Large 2407Mistral AI▫ n.d.58,0 %19 novembre 2024✅ Mesuré
108llama-4-scout-17b-16e-instructMeta▫ n.d.58,0 %✅ Mesuré
109uncensoredvenice▫ n.d.57,1 %✅ Mesuré
110GPT-4.1 nanoOpenAI🔒 Propriétaire56,0 %14 avril 2025✅ Mesuré
111GPT-4o miniOpenAI🔒 Propriétaire56,0 %18 juillet 2024✅ Mesuré
112cydonia-24b-v4.1thedrummer▫ n.d.56,0 %✅ Mesuré
113qwen3-8b-04-28Alibaba Cloud / Qwen Team▫ n.d.56,0 %✅ Mesuré
114Perceptron: Perceptron Mk1Perceptron▫ n.d.55,1 %12 mai 2026✅ Mesuré
115AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert54,0 %8 août 2025✅ Mesuré
116Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert54,0 %17 avril 2024✅ Mesuré
117Nous: Hermes 4 70BNous Research🟢 Ouvert54,0 %26 août 2025✅ Mesuré
118Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert52,0 %30 juin 2025✅ Mesuré
119Inflection: Inflection 3 PiInflection🔒 Propriétaire52,0 %11 octobre 2024✅ Mesuré
120Upstage: Solar Pro 3Upstage▫ n.d.52,0 %27 janvier 2026✅ Mesuré
121hermes-3-llama-3.1-70bnousresearch▫ n.d.52,0 %✅ Mesuré
122ministral-14b-2512mistralai▫ n.d.52,0 %✅ Mesuré
123ministral-8b-2512mistralai▫ n.d.52,0 %✅ Mesuré
124MiniMax: MiniMax M2-herMiniMax▫ n.d.50,0 %23 janvier 2026✅ Mesuré
125StepFun: Step 3.7 FlashStepFun🟢 Ouvert50,0 %28 mai 2026✅ Mesuré
126WizardLM-2 8x22BMicrosoft🟢 Ouvert50,0 %16 avril 2024✅ Mesuré
127command-r-plus-08-2024Cohere▫ n.d.48,0 %✅ Mesuré
128nova-pro-v1Amazon🔒 Propriétaire48,0 %✅ Mesuré
129IBM: Granite 4.1 8BIBM🟢 Ouvert46,0 %30 avril 2026✅ Mesuré
130Mistral: Codestral 2508Mistral AI▫ n.d.46,0 %1 août 2025✅ Mesuré
131granite-4.0-h-microIBM🟢 Ouvert44,7 %20 octobre 2025✅ Mesuré
132nova-2-lite-v1Amazon🔒 Propriétaire42,0 %2 décembre 2025✅ Mesuré
133inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.38,0 %21 avril 2026✅ Mesuré
134Claude 3 HaikuAnthropic🔒 Propriétaire36,0 %13 mars 2024✅ Mesuré
135ui-tars-1.5-7bByteDance▫ n.d.36,0 %✅ Mesuré
136Cohere: Command R (08-2024)Cohere🟢 Ouvert34,0 %30 août 2024✅ Mesuré
137inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.33,3 %23 avril 2026✅ Mesuré
138l3.1-euryale-70bsao10k▫ n.d.30,0 %✅ Mesuré
139Mistral NeMoMistral AI▫ n.d.28,0 %18 juillet 2024✅ Mesuré
140rocinante-12bthedrummer▫ n.d.26,0 %✅ Mesuré
141Cohere: Command R7B (12-2024)Cohere▫ n.d.24,5 %14 décembre 2024✅ Mesuré
142Meta: Llama 3.2 1B InstructMeta🟢 Ouvert22,0 %25 septembre 2024✅ Mesuré
143l3.3-euryale-70b-v2.3sao10k▫ n.d.22,0 %✅ Mesuré
144ministral-3b-2512mistralai▫ n.d.22,0 %✅ Mesuré
145unslopnemo-12bthedrummer▫ n.d.20,4 %✅ Mesuré
146l3-lunaris-8bsao10k▫ n.d.20,0 %✅ Mesuré
147reka-edge-2603Reka AI▫ n.d.14,0 %✅ Mesuré
148aion-rp-llama-3.1-8bAion Labs▫ n.d.12,0 %✅ Mesuré
149mythomax-l2-13bgryphe▫ n.d.10,0 %✅ Mesuré
150remm-slerp-l2-13bundi95▫ n.d.6,0 %✅ Mesuré
151weavermancer▫ n.d.4,0 %✅ Mesuré
152nova-micro-v1Amazon🔒 Propriétaire2,0 %✅ Mesuré
153Qwen 3.5 PlusQwen▫ n.d.0,0 %16 février 2026✅ Mesuré
154Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %25 février 2026✅ Mesuré
155Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %27 avril 2026✅ Mesuré
156qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.0,0 %2 avril 2026✅ Mesuré

Classement établi sur 156 modèles évalués, dont 63 de grands éditeurs. Score médian de l'ensemble : 78,0 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une grande proportion de ces tâches ouvertes et restitue la réponse attendue avec une équivalence sémantique suffisante. La validation est contrôlée par une IA sur le champ JSON Path $.answer, ce qui permet de reconnaître des formulations équivalentes sans imposer une correspondance textuelle stricte. Les scores sont au moins partiellement mesurés par un tiers, leur portée ne repose donc pas uniquement sur des résultats auto-déclarés.

Le niveau médian de 80 % parmi 246 modèles montre que l’ensemble est déjà bien maîtrisé par une part importante du classement. Le score de 100 % obtenu par AionLabs: Aion-2.0 signale une saturation au sommet, où ce benchmark ne distingue plus les modèles ayant résolu toutes les questions. Son format limité à 50 tâches en anglais circonscrit aussi l’interprétation aux formes de raisonnement représentées. Enfin, son accès public crée un risque de contamination lors de l’entraînement ou de l’évaluation. Le classement révèle donc surtout des écarts sur ce socle ciblé de logique et de résolution abstraite.


Sources des scores : benchable.