Coding (Baseline)

Benchable : Coding (Baseline) est un benchmark public créé par Benchable pour tester les connaissances générales en programmation. Il prend la forme de questions à choix multiple en anglais, avec six réponses possibles, et couvre plusieurs langages ainsi que différents niveaux de…

Benchable : Coding (Baseline) est un benchmark public créé par Benchable pour tester les connaissances générales en programmation. Il prend la forme de questions à choix multiple en anglais, avec six réponses possibles, et couvre plusieurs langages ainsi que différents niveaux de difficulté.

Son contenu va de la syntaxe élémentaire aux algorithmes, structures de données, bases de données, réseaux, design patterns et mécanismes de concurrence. Il sert à comparer la capacité des modèles à reconnaître précisément une réponse correcte dans un large éventail de sujets techniques.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesConnaissances en programmation : de la syntaxe de base aux algorithmes, structures de donnees, concurrence, bases de donnees, design patterns, reseaux
ModalitéTexte
Type de questionsQCM (6 options A-F)
Métrique d'évaluationLettre de l'option correcte (Exact Match, JSON Path $.answer)
AccèsPublic
Languesanglais (enonces) ; couvre Python, JavaScript, Java, C++, Go, SQL, PHP, Ruby, Rust, TypeScript, C#, Scala, Haskell
Taille du jeu100 questions
RessourcesSite / dépôt officiel

Classement des modèles (163)

#ModèleÉditeurLicenceScoreSortieFiabilité
1StepFun: Step 3.7 FlashStepFun🟢 Ouvert100,0 %28 mai 2026✅ Mesuré
2cydonia-24b-v4.1thedrummer▫ n.d.100,0 %✅ Mesuré
3gemini-3-pro-imageGoogle▫ n.d.97,0 %✅ Mesuré
4qwen3-235b-a22b-04-28Alibaba Cloud / Qwen Team▫ n.d.97,0 %✅ Mesuré
5Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.96,9 %25 février 2026✅ Mesuré
6Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.96,1 %10 juillet 2026✅ Mesuré
7GPT-5.2OpenAI🔒 Propriétaire96,0 %11 décembre 2025✅ Mesuré
8Grok 4.5xAI🔒 Propriétaire96,0 %16 juillet 2026✅ Mesuré
9OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire96,0 %5 mai 2026✅ Mesuré
10OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire96,0 %10 décembre 2025✅ Mesuré
11gemini-2.5-pro-preview-03-25Google▫ n.d.96,0 %✅ Mesuré
12gemini-3.1-flash-image-previewGoogle▫ n.d.96,0 %✅ Mesuré
13AionLabs: Aion-3.0Aion Labs▫ n.d.96,0 %7 juillet 2026✅ Mesuré
14Gemini 3.1 Pro PreviewGoogle▫ n.d.96,0 %19 février 2026✅ Mesuré
15Z.ai: GLM 5 TurboZhipu AI▫ n.d.95,5 %15 mars 2026✅ Mesuré
16DeepSeek V4 ProDeepSeek▫ n.d.95,5 %24 avril 2026✅ Mesuré
17AionLabs: Aion-3.0-MiniAion Labs▫ n.d.95,0 %7 juillet 2026✅ Mesuré
18Claude Opus 4.5Anthropic🔒 Propriétaire95,0 %24 novembre 2025✅ Mesuré
19Claude Sonnet 4.5Anthropic🔒 Propriétaire95,0 %29 septembre 2025✅ Mesuré
20GPT-5 miniOpenAI🔒 Propriétaire95,0 %7 août 2025✅ Mesuré
21GPT-5.6 LunaOpenAI🔒 Propriétaire95,0 %9 juillet 2026✅ Mesuré
22GPT-5.6 SolOpenAI🔒 Propriétaire95,0 %9 juillet 2026✅ Mesuré
23GPT-5.6 TerraOpenAI🔒 Propriétaire95,0 %9 juillet 2026✅ Mesuré
24OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire95,0 %4 décembre 2025✅ Mesuré
25OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire95,0 %9 juillet 2026✅ Mesuré
26OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire95,0 %9 juillet 2026✅ Mesuré
27OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire95,0 %9 juillet 2026✅ Mesuré
28OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert95,0 %29 octobre 2025✅ Mesuré
29qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.95,0 %✅ Mesuré
30xAI: Grok Build 0.1xAI▫ n.d.95,0 %20 mai 2026✅ Mesuré
31qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.94,9 %✅ Mesuré
32ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.94,0 %26 février 2026✅ Mesuré
33Claude Opus 4Anthropic🔒 Propriétaire94,0 %22 mai 2025✅ Mesuré
34Claude Opus 4.1Anthropic🔒 Propriétaire94,0 %5 août 2025✅ Mesuré
35DeepSeek V4 FlashDeepSeek▫ n.d.94,0 %24 avril 2026✅ Mesuré
36GPT-5.1OpenAI🔒 Propriétaire94,0 %13 novembre 2025✅ Mesuré
37OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire94,0 %13 novembre 2025✅ Mesuré
38Seed 1.6ByteDance Seed▫ n.d.94,0 %23 décembre 2025✅ Mesuré
39gemini-3.1-flash-imageGoogle▫ n.d.94,0 %✅ Mesuré
40qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.94,0 %✅ Mesuré
41AionLabs: Aion-2.0Aion Labs▫ n.d.93,5 %23 février 2026✅ Mesuré
42Claude Sonnet 4Anthropic🔒 Propriétaire93,0 %22 mai 2025✅ Mesuré
43GPT-4oOpenAI🔒 Propriétaire93,0 %27 mars 2025✅ Mesuré
44GPT-5OpenAI🔒 Propriétaire93,0 %7 août 2025✅ Mesuré
45GPT-5 nanoOpenAI🔒 Propriétaire93,0 %7 août 2025✅ Mesuré
46Kimi K2Moonshot AI▫ n.d.93,0 %6 novembre 2025✅ Mesuré
47Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert93,0 %8 juin 2026✅ Mesuré
48Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert93,0 %29 juillet 2025✅ Mesuré
49Tencent: Hy3 previewTencent🟢 Ouvert93,0 %22 avril 2026✅ Mesuré
50gpt-5-chat-2025-08-07OpenAI🔒 Propriétaire93,0 %7 août 2025✅ Mesuré
51mistral-small-2603mistralai▫ n.d.93,0 %✅ Mesuré
52Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert92,9 %1 avril 2026✅ Mesuré
53Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert92,9 %28 août 2025✅ Mesuré
54Hy3Tencent🟢 Ouvert92,9 %6 juillet 2026✅ Mesuré
55Thinking Machines: InklingThinking Machines🟢 Ouvert92,2 %17 juillet 2026✅ Mesuré
56GPT-4.1 miniOpenAI🔒 Propriétaire92,0 %14 avril 2025✅ Mesuré
57Mistral: Mistral Medium 3.1Mistral AI▫ n.d.92,0 %13 août 2025✅ Mesuré
58Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire92,0 %30 octobre 2025✅ Mesuré
59Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.92,0 %17 septembre 2025✅ Mesuré
60deepseek-chat-v3-0324DeepSeek▫ n.d.92,0 %✅ Mesuré
61laguna-xs-2.1poolside▫ n.d.92,0 %✅ Mesuré
62o1OpenAI🔒 Propriétaire92,0 %17 décembre 2024✅ Mesuré
63olmo-3-32b-thinkallenai▫ n.d.92,0 %✅ Mesuré
64qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.92,0 %✅ Mesuré
65inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.91,7 %8 mai 2026✅ Mesuré
66Claude Haiku 4.5Anthropic🔒 Propriétaire91,0 %15 octobre 2025✅ Mesuré
67Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.91,0 %13 novembre 2025✅ Mesuré
68GPT-4.1OpenAI🔒 Propriétaire91,0 %14 avril 2025✅ Mesuré
69MiniMax M1MiniMax🟢 Ouvert91,0 %17 juin 2025✅ Mesuré
70Relace: Relace Searchrelace▫ n.d.91,0 %8 décembre 2025✅ Mesuré
71laguna-m.1poolside▫ n.d.91,0 %✅ Mesuré
72mistral-large-2512mistralai▫ n.d.91,0 %✅ Mesuré
73qwen3-14b-04-28Alibaba Cloud / Qwen Team▫ n.d.91,0 %✅ Mesuré
74DeepSeek V3.1 TerminusDeepSeek🟢 Ouvert90,0 %22 septembre 2025✅ Mesuré
75Tencent: Hunyuan A13B InstructTencent🟢 Ouvert90,0 %8 juillet 2025✅ Mesuré
76qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert89,5 %4 février 2026✅ Mesuré
77Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert89,0 %30 juin 2025✅ Mesuré
78Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,0 %31 juillet 2025✅ Mesuré
79Reka Flash 3Reka AI🟢 Ouvert89,0 %12 mars 2025✅ Mesuré
80deepseek-chat-v3DeepSeek▫ n.d.89,0 %✅ Mesuré
81deepseek-chat-v3.1DeepSeek▫ n.d.89,0 %✅ Mesuré
82gpt-4o-search-preview-2025-03-11OpenAI🔒 Propriétaire89,0 %12 mars 2025✅ Mesuré
83Command A+Cohere🟢 Ouvert88,0 %20 mai 2026✅ Mesuré
84devstral-2512mistralai▫ n.d.88,0 %✅ Mesuré
85nova-2-lite-v1Amazon🔒 Propriétaire88,0 %2 décembre 2025✅ Mesuré
86qwen3-coder-480b-a35b-07-25Alibaba Cloud / Qwen Team▫ n.d.88,0 %✅ Mesuré
87ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.87,0 %23 décembre 2025✅ Mesuré
88GPT-4o miniOpenAI🔒 Propriétaire87,0 %18 juillet 2024✅ Mesuré
89Mistral: Mistral Medium 3Mistral AI▫ n.d.87,0 %7 mai 2025✅ Mesuré
90OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire87,0 %21 avril 2026✅ Mesuré
91ministral-14b-2512mistralai▫ n.d.87,0 %✅ Mesuré
92ministral-8b-2512mistralai▫ n.d.87,0 %✅ Mesuré
93Muse Spark 1.1Meta🔒 Propriétaire86,9 %9 juillet 2026✅ Mesuré
94qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.85,9 %✅ Mesuré
95kimi-k2.5-0127Moonshot AI▫ n.d.85,0 %✅ Mesuré
96hermes-3-llama-3.1-405bnousresearch▫ n.d.85,0 %✅ Mesuré
97Arcee AI: Virtuoso LargeArcee AI▫ n.d.84,0 %5 mai 2025✅ Mesuré
98GPT-4.1 nanoOpenAI🔒 Propriétaire84,0 %14 avril 2025✅ Mesuré
99Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.84,0 %10 juillet 2026✅ Mesuré
100nova-pro-v1Amazon🔒 Propriétaire84,0 %✅ Mesuré
101qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.84,0 %8 septembre 2025✅ Mesuré
102Writer: Palmyra X5Writer▫ n.d.83,3 %21 janvier 2026✅ Mesuré
103Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert83,0 %17 avril 2024✅ Mesuré
104Nous: Hermes 4 405BNous Research🟢 Ouvert83,0 %26 août 2025✅ Mesuré
105Mistral LargeMistral AI▫ n.d.82,0 %26 février 2024✅ Mesuré
106Mistral Large 2407Mistral AI▫ n.d.82,0 %19 novembre 2024✅ Mesuré
107SonarPerplexity🔒 Propriétaire82,0 %29 janvier 2025✅ Mesuré
108Upstage: Solar Pro 3Upstage▫ n.d.82,0 %27 janvier 2026✅ Mesuré
109nova-micro-v1Amazon🔒 Propriétaire82,0 %✅ Mesuré
110uncensoredvenice▫ n.d.81,8 %✅ Mesuré
111Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.81,0 %27 mars 2026✅ Mesuré
112MiniMax: MiniMax-01MiniMax🟢 Ouvert81,0 %15 janvier 2025✅ Mesuré
113hermes-3-llama-3.1-70bnousresearch▫ n.d.81,0 %✅ Mesuré
114Mistral: Voxtral Small 24B 2507Mistral AI🟢 Ouvert80,0 %30 octobre 2025✅ Mesuré
115Sonar ProPerplexity🔒 Propriétaire80,0 %7 mars 2025✅ Mesuré
116gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire80,0 %12 mars 2025✅ Mesuré
117llama-4-maverick-17b-128e-instructMeta▫ n.d.79,5 %✅ Mesuré
118llama-4-scout-17b-16e-instructMeta▫ n.d.79,5 %✅ Mesuré
119Mistral NeMoMistral AI▫ n.d.79,0 %18 juillet 2024✅ Mesuré
120mistral-saba-2502mistralai▫ n.d.79,0 %✅ Mesuré
121mistral-small-24b-instruct-2501mistralai▫ n.d.79,0 %✅ Mesuré
122IBM: Granite 4.1 8BIBM🟢 Ouvert78,0 %30 avril 2026✅ Mesuré
123ministral-3b-2512mistralai▫ n.d.78,0 %✅ Mesuré
124Perceptron: Perceptron Mk1Perceptron▫ n.d.77,8 %12 mai 2026✅ Mesuré
125Cohere: Command R (08-2024)Cohere🟢 Ouvert77,0 %30 août 2024✅ Mesuré
126command-r-plus-08-2024Cohere▫ n.d.77,0 %✅ Mesuré
127skyfall-36b-v2thedrummer▫ n.d.77,0 %✅ Mesuré
128inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.76,9 %23 avril 2026✅ Mesuré
129rocinante-12bthedrummer▫ n.d.76,0 %✅ Mesuré
130Cohere: Command R7B (12-2024)Cohere▫ n.d.74,0 %14 décembre 2024✅ Mesuré
131Claude 3 HaikuAnthropic🔒 Propriétaire72,0 %13 mars 2024✅ Mesuré
132Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert72,0 %24 juin 2026✅ Mesuré
133OpenAI: GPT-3.5 Turbo InstructOpenAI🔒 Propriétaire71,0 %28 septembre 2023✅ Mesuré
134ui-tars-1.5-7bByteDance▫ n.d.68,0 %✅ Mesuré
135AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert67,0 %8 août 2025✅ Mesuré
136unslopnemo-12bthedrummer▫ n.d.67,0 %✅ Mesuré
137nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert65,6 %28 octobre 2025✅ Mesuré
138WizardLM-2 8x22BMicrosoft🟢 Ouvert62,0 %16 avril 2024✅ Mesuré
139Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire57,0 %11 octobre 2024✅ Mesuré
140Inflection: Inflection 3 PiInflection🔒 Propriétaire56,0 %11 octobre 2024✅ Mesuré
141Nous: Hermes 4 70BNous Research🟢 Ouvert55,0 %26 août 2025✅ Mesuré
142Mistral: Codestral 2508Mistral AI▫ n.d.48,0 %1 août 2025✅ Mesuré
143aion-rp-llama-3.1-8bAion Labs▫ n.d.47,0 %✅ Mesuré
144nova-premier-v1Amazon🔒 Propriétaire43,0 %✅ Mesuré
145inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.37,0 %21 avril 2026✅ Mesuré
146qwen3-8b-04-28Alibaba Cloud / Qwen Team▫ n.d.34,0 %✅ Mesuré
147MiniMax: MiniMax M2-herMiniMax▫ n.d.25,0 %23 janvier 2026✅ Mesuré
148granite-4.0-h-microIBM🟢 Ouvert22,7 %20 octobre 2025✅ Mesuré
149l3.1-euryale-70bsao10k▫ n.d.22,0 %✅ Mesuré
150l3.3-euryale-70b-v2.3sao10k▫ n.d.21,0 %✅ Mesuré
151GPT-4OpenAI🔒 Propriétaire7,0 %28 août 2023✅ Mesuré
152l3-lunaris-8bsao10k▫ n.d.4,0 %✅ Mesuré
153mythomax-l2-13bgryphe▫ n.d.3,0 %✅ Mesuré
154weavermancer▫ n.d.3,0 %✅ Mesuré
155remm-slerp-l2-13bundi95▫ n.d.1,0 %✅ Mesuré
156Meta: Llama 3.2 1B InstructMeta🟢 Ouvert0,0 %25 septembre 2024✅ Mesuré
157Meta: Llama Guard 4 12BMeta🟢 Ouvert0,0 %30 avril 2025✅ Mesuré
158Morph: Morph V3 Fastmorph▫ n.d.0,0 %7 juillet 2025✅ Mesuré
159Morph: Morph V3 Largemorph▫ n.d.0,0 %7 juillet 2025✅ Mesuré
160Qwen 3.5 PlusQwen▫ n.d.0,0 %16 février 2026✅ Mesuré
161Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %25 février 2026✅ Mesuré
162Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %27 avril 2026✅ Mesuré
163qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.0,0 %2 avril 2026✅ Mesuré

Classement établi sur 163 modèles évalués, dont 69 de grands éditeurs. Score médian de l'ensemble : 89,0 %.

Notre analyse

Un score élevé indique une forte maîtrise des connaissances de programmation couvertes et une bonne capacité à sélectionner la réponse attendue parmi six options. La validation par Exact Match sur la lettre fournie rend la notation stricte et reproductible, sans crédit partiel. Les scores sont au moins partiellement mesurés par un tiers, ce qui leur confère une assise plus robuste que des résultats uniquement auto-déclarés.

Le score médian de 89 % parmi 254 modèles et le résultat parfait de Qwen3 VL 32B Instruct suggèrent toutefois une saturation importante du benchmark. Les écarts en tête du classement peuvent donc devenir faibles et moins discriminants. Son accès public crée aussi un risque de contamination, les questions pouvant avoir été intégrées à des corpus d'entraînement ou d'évaluation. Enfin, sa portée reste celle d'un QCM de connaissances : il évalue la reconnaissance d'une option correcte dans plusieurs langages et domaines, plutôt que la production directe de code. Le classement révèle ainsi un niveau globalement élevé, avec au moins un modèle atteignant le plafond du test.


Sources des scores : benchable.