Mathematics (Baseline)

Benchable : Mathematics (Baseline) est un benchmark public créé par Benchable pour évaluer les compétences mathématiques des modèles d’intelligence artificielle. Il couvre un spectre allant de l’arithmétique élémentaire au calcul, à l’algèbre linéaire, à la topologie et à la géométrie…

Benchable : Mathematics (Baseline) est un benchmark public créé par Benchable pour évaluer les compétences mathématiques des modèles d’intelligence artificielle. Il couvre un spectre allant de l’arithmétique élémentaire au calcul, à l’algèbre linéaire, à la topologie et à la géométrie algébrique.

Son corpus en anglais comprend également des problèmes inédits de niveau doctoral. Présentées sous forme de QCM à six options, les réponses sont validées par correspondance exacte de la lettre attendue. Le benchmark fournit ainsi une mesure standardisée de la capacité à sélectionner une réponse correcte dans des domaines mathématiques variés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesMathematiques a tous niveaux : de l'arithmetique elementaire au calcul, algebre lineaire, topologie, geometrie algebrique et problemes de niveau doctoral
ModalitéTexte
Type de questionsQCM (6 options A-F)
Métrique d'évaluationLettre de la reponse correcte (Exact Match, JSON Path $.answer)
AccèsPublic
Languesanglais
Taille du jeu100 questions
RessourcesSite / dépôt officiel

Classement des modèles (141)

#ModèleÉditeurLicenceScoreSortieFiabilité
1StepFun: Step 3.7 FlashStepFun🟢 Ouvert100,0 %28 mai 2026✅ Mesuré
2Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert97,5 %1 avril 2026✅ Mesuré
3Writer: Palmyra X5Writer▫ n.d.97,2 %21 janvier 2026✅ Mesuré
4gemini-3-pro-imageGoogle▫ n.d.97,0 %✅ Mesuré
5qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.97,0 %✅ Mesuré
6kimi-k2.5-0127Moonshot AI▫ n.d.96,8 %✅ Mesuré
7inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.96,4 %23 avril 2026✅ Mesuré
8AionLabs: Aion-2.0Aion Labs▫ n.d.96,0 %23 février 2026✅ Mesuré
9AionLabs: Aion-3.0Aion Labs▫ n.d.96,0 %7 juillet 2026✅ Mesuré
10Claude Opus 4.5Anthropic🔒 Propriétaire96,0 %24 novembre 2025✅ Mesuré
11Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.96,0 %13 novembre 2025✅ Mesuré
12GPT-4.1OpenAI🔒 Propriétaire96,0 %14 avril 2025✅ Mesuré
13GPT-5.6 SolOpenAI🔒 Propriétaire96,0 %9 juillet 2026✅ Mesuré
14Seed 1.6ByteDance Seed▫ n.d.96,0 %23 décembre 2025✅ Mesuré
15Gemini 3.1 Pro PreviewGoogle▫ n.d.95,9 %19 février 2026✅ Mesuré
16Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.95,9 %25 février 2026✅ Mesuré
17qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.95,9 %✅ Mesuré
18Thinking Machines: InklingThinking Machines🟢 Ouvert95,8 %17 juillet 2026✅ Mesuré
19gemini-2.5-pro-preview-03-25Google▫ n.d.95,8 %✅ Mesuré
20Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.95,4 %10 juillet 2026✅ Mesuré
21AionLabs: Aion-3.0-MiniAion Labs▫ n.d.95,0 %7 juillet 2026✅ Mesuré
22GPT-4.1 miniOpenAI🔒 Propriétaire95,0 %14 avril 2025✅ Mesuré
23Kimi K2Moonshot AI▫ n.d.95,0 %6 novembre 2025✅ Mesuré
24Z.ai: GLM 5 TurboZhipu AI▫ n.d.95,0 %15 mars 2026✅ Mesuré
25deepseek-chat-v3-0324DeepSeek▫ n.d.95,0 %✅ Mesuré
26Hy3Tencent🟢 Ouvert94,7 %6 juillet 2026✅ Mesuré
27llama-4-maverick-17b-128e-instructMeta▫ n.d.94,5 %✅ Mesuré
28DeepSeek V4 ProDeepSeek▫ n.d.94,4 %24 avril 2026✅ Mesuré
29Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.94,4 %10 juillet 2026✅ Mesuré
30Claude Opus 4Anthropic🔒 Propriétaire94,0 %22 mai 2025✅ Mesuré
31Claude Sonnet 4.5Anthropic🔒 Propriétaire94,0 %29 septembre 2025✅ Mesuré
32DeepSeek V4 FlashDeepSeek▫ n.d.94,0 %24 avril 2026✅ Mesuré
33GPT-5 miniOpenAI🔒 Propriétaire94,0 %7 août 2025✅ Mesuré
34GPT-5 nanoOpenAI🔒 Propriétaire94,0 %7 août 2025✅ Mesuré
35GPT-5.6 LunaOpenAI🔒 Propriétaire94,0 %9 juillet 2026✅ Mesuré
36GPT-5.6 TerraOpenAI🔒 Propriétaire94,0 %9 juillet 2026✅ Mesuré
37OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire94,0 %10 décembre 2025✅ Mesuré
38OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire94,0 %9 juillet 2026✅ Mesuré
39OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire94,0 %9 juillet 2026✅ Mesuré
40Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert94,0 %29 juillet 2025✅ Mesuré
41Tencent: Hy3 previewTencent🟢 Ouvert94,0 %22 avril 2026✅ Mesuré
42mistral-large-2512mistralai▫ n.d.94,0 %✅ Mesuré
43Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert93,9 %28 août 2025✅ Mesuré
44Claude Haiku 4.5Anthropic🔒 Propriétaire93,0 %15 octobre 2025✅ Mesuré
45Claude Sonnet 4Anthropic🔒 Propriétaire93,0 %22 mai 2025✅ Mesuré
46Grok 4.5xAI🔒 Propriétaire93,0 %16 juillet 2026✅ Mesuré
47Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.93,0 %27 mars 2026✅ Mesuré
48Mistral LargeMistral AI▫ n.d.93,0 %26 février 2024✅ Mesuré
49Mistral: Mistral Medium 3Mistral AI▫ n.d.93,0 %7 mai 2025✅ Mesuré
50Mistral: Mistral Medium 3.1Mistral AI▫ n.d.93,0 %13 août 2025✅ Mesuré
51Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert93,0 %8 juin 2026✅ Mesuré
52OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire93,0 %5 mai 2026✅ Mesuré
53OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire93,0 %13 novembre 2025✅ Mesuré
54OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire93,0 %4 décembre 2025✅ Mesuré
55OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire93,0 %9 juillet 2026✅ Mesuré
56qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.93,0 %✅ Mesuré
57qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.93,0 %✅ Mesuré
58xAI: Grok Build 0.1xAI▫ n.d.93,0 %20 mai 2026✅ Mesuré
59Claude Opus 4.1Anthropic🔒 Propriétaire92,9 %5 août 2025✅ Mesuré
60GPT-4.1 nanoOpenAI🔒 Propriétaire92,5 %14 avril 2025✅ Mesuré
61GPT-5OpenAI🔒 Propriétaire92,0 %7 août 2025✅ Mesuré
62GPT-5.1OpenAI🔒 Propriétaire92,0 %13 novembre 2025✅ Mesuré
63GPT-5.2OpenAI🔒 Propriétaire92,0 %11 décembre 2025✅ Mesuré
64OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire92,0 %21 avril 2026✅ Mesuré
65Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire92,0 %30 octobre 2025✅ Mesuré
66deepseek-chat-v3DeepSeek▫ n.d.92,0 %✅ Mesuré
67gemini-3.1-flash-imageGoogle▫ n.d.92,0 %✅ Mesuré
68gpt-4o-search-preview-2025-03-11OpenAI🔒 Propriétaire92,0 %12 mars 2025✅ Mesuré
69laguna-xs-2.1poolside▫ n.d.92,0 %✅ Mesuré
70mistral-small-2603mistralai▫ n.d.92,0 %✅ Mesuré
71inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.91,7 %8 mai 2026✅ Mesuré
72DeepSeek V3.1 TerminusDeepSeek🟢 Ouvert91,0 %22 septembre 2025✅ Mesuré
73gemini-3.1-flash-image-previewGoogle▫ n.d.91,0 %✅ Mesuré
74laguna-m.1poolside▫ n.d.91,0 %✅ Mesuré
75qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.91,0 %8 septembre 2025✅ Mesuré
76deepseek-chat-v3.1DeepSeek▫ n.d.90,9 %✅ Mesuré
77qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert90,7 %4 février 2026✅ Mesuré
78GPT-4oOpenAI🔒 Propriétaire90,0 %27 mars 2025✅ Mesuré
79OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert89,0 %29 octobre 2025✅ Mesuré
80Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,0 %31 juillet 2025✅ Mesuré
81olmo-3-32b-thinkallenai▫ n.d.89,0 %✅ Mesuré
82qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.88,9 %✅ Mesuré
83Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert88,0 %30 juin 2025✅ Mesuré
84Mistral Large 2407Mistral AI▫ n.d.88,0 %19 novembre 2024✅ Mesuré
85SonarPerplexity🔒 Propriétaire88,0 %29 janvier 2025✅ Mesuré
86MiniMax M1MiniMax🟢 Ouvert87,5 %17 juin 2025✅ Mesuré
87ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.87,0 %26 février 2026✅ Mesuré
88Muse Spark 1.1Meta🔒 Propriétaire87,0 %9 juillet 2026✅ Mesuré
89o1OpenAI🔒 Propriétaire87,0 %17 décembre 2024✅ Mesuré
90Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert86,0 %17 avril 2024✅ Mesuré
91Sonar ProPerplexity🔒 Propriétaire86,0 %7 mars 2025✅ Mesuré
92WizardLM-2 8x22BMicrosoft🟢 Ouvert86,0 %16 avril 2024✅ Mesuré
93Command A+Cohere🟢 Ouvert85,0 %20 mai 2026✅ Mesuré
94Relace: Relace Searchrelace▫ n.d.85,0 %8 décembre 2025✅ Mesuré
95Upstage: Solar Pro 3Upstage▫ n.d.85,0 %27 janvier 2026✅ Mesuré
96qwen3-8b-04-28Alibaba Cloud / Qwen Team▫ n.d.85,0 %✅ Mesuré
97Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.84,0 %17 septembre 2025✅ Mesuré
98gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire84,0 %12 mars 2025✅ Mesuré
99nova-2-lite-v1Amazon🔒 Propriétaire83,0 %2 décembre 2025✅ Mesuré
100ministral-3b-2512mistralai▫ n.d.82,0 %✅ Mesuré
101ministral-14b-2512mistralai▫ n.d.81,0 %✅ Mesuré
102uncensoredvenice▫ n.d.81,0 %✅ Mesuré
103ministral-8b-2512mistralai▫ n.d.80,0 %✅ Mesuré
104Arcee AI: Virtuoso LargeArcee AI▫ n.d.79,0 %5 mai 2025✅ Mesuré
105Nous: Hermes 4 405BNous Research🟢 Ouvert79,0 %26 août 2025✅ Mesuré
106ui-tars-1.5-7bByteDance▫ n.d.78,0 %✅ Mesuré
107qwen3-coder-480b-a35b-07-25Alibaba Cloud / Qwen Team▫ n.d.77,8 %✅ Mesuré
108ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.77,0 %23 décembre 2025✅ Mesuré
109hermes-3-llama-3.1-405bnousresearch▫ n.d.77,0 %✅ Mesuré
110Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert76,5 %24 juin 2026✅ Mesuré
111cydonia-24b-v4.1thedrummer▫ n.d.73,9 %✅ Mesuré
112GPT-4o miniOpenAI🔒 Propriétaire71,0 %18 juillet 2024✅ Mesuré
113IBM: Granite 4.1 8BIBM🟢 Ouvert71,0 %30 avril 2026✅ Mesuré
114Cohere: Command R (08-2024)Cohere🟢 Ouvert70,0 %30 août 2024✅ Mesuré
115command-r-plus-08-2024Cohere▫ n.d.70,0 %✅ Mesuré
116Nous: Hermes 4 70BNous Research🟢 Ouvert69,0 %26 août 2025✅ Mesuré
117hermes-3-llama-3.1-70bnousresearch▫ n.d.68,0 %✅ Mesuré
118Cohere: Command R7B (12-2024)Cohere▫ n.d.62,0 %14 décembre 2024✅ Mesuré
119Inflection: Inflection 3 PiInflection🔒 Propriétaire59,0 %11 octobre 2024✅ Mesuré
120Tencent: Hunyuan A13B InstructTencent🟢 Ouvert59,0 %8 juillet 2025✅ Mesuré
121Claude 3 HaikuAnthropic🔒 Propriétaire58,0 %13 mars 2024✅ Mesuré
122Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire57,0 %11 octobre 2024✅ Mesuré
123nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert52,6 %28 octobre 2025✅ Mesuré
124nova-premier-v1Amazon🔒 Propriétaire48,0 %✅ Mesuré
125nova-pro-v1Amazon🔒 Propriétaire42,0 %✅ Mesuré
126AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert40,0 %8 août 2025✅ Mesuré
127llama-4-scout-17b-16e-instructMeta▫ n.d.39,0 %✅ Mesuré
128nova-micro-v1Amazon🔒 Propriétaire39,0 %✅ Mesuré
129inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.37,0 %21 avril 2026✅ Mesuré
130l3-lunaris-8bsao10k▫ n.d.19,0 %✅ Mesuré
131Mistral NeMoMistral AI▫ n.d.15,0 %18 juillet 2024✅ Mesuré
132l3.3-euryale-70b-v2.3sao10k▫ n.d.13,0 %✅ Mesuré
133Mistral: Codestral 2508Mistral AI▫ n.d.3,0 %1 août 2025✅ Mesuré
134Meta: Llama 3.2 1B InstructMeta🟢 Ouvert0,0 %25 septembre 2024✅ Mesuré
135MiniMax: MiniMax-01MiniMax🟢 Ouvert0,0 %15 janvier 2025✅ Mesuré
136Qwen 3.5 PlusQwen▫ n.d.0,0 %16 février 2026✅ Mesuré
137Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %25 février 2026✅ Mesuré
138Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %27 avril 2026✅ Mesuré
139granite-4.0-h-microIBM🟢 Ouvert0,0 %20 octobre 2025✅ Mesuré
140qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.0,0 %2 avril 2026✅ Mesuré
141weavermancer▫ n.d.0,0 %✅ Mesuré

Classement établi sur 141 modèles évalués, dont 64 de grands éditeurs. Score médian de l'ensemble : 91,7 %.

Notre analyse

Un score élevé indique une forte aptitude à identifier la bonne option parmi six réponses sur ce corpus, dans des disciplines et à des niveaux de difficulté très variés. La validation par Exact Match impose une sortie strictement conforme, mais elle mesure la lettre finale plutôt que la qualité du raisonnement. La fiabilité est renforcée par des scores au moins partiellement mesurés par un tiers, ce qui apporte davantage de rigueur qu’un ensemble reposant uniquement sur des résultats auto-déclarés.

Avec une médiane de 92 % parmi 225 modèles et un meilleur score de 100 % obtenu par Qwen3 VL 32B Instruct, le classement montre un niveau global très élevé. Cette concentration près du maximum signale une saturation partielle et réduit le pouvoir de discrimination entre les modèles les plus performants. Le caractère public du benchmark implique aussi un risque d’exposition préalable aux questions, donc de contamination. Enfin, ses 100 QCM évaluent une portée mathématique large, mais restent centrés sur la sélection d’une réponse en anglais, sans évaluation directe d’une démonstration ou d’un raisonnement développé.


Sources des scores : benchable.