IMO-AnswerBench

IMO-AnswerBench est un benchmark public conçu par Google DeepMind pour évaluer le raisonnement mathématique de niveau olympiade. Il repose sur des problèmes inspirés de l’International Mathematical Olympiad, formulés en anglais et associés à une réponse courte, unique et vérifiable.

IMO-AnswerBench est un benchmark public conçu par Google DeepMind pour évaluer le raisonnement mathématique de niveau olympiade. Il repose sur des problèmes inspirés de l’International Mathematical Olympiad, formulés en anglais et associés à une réponse courte, unique et vérifiable.

Le benchmark examine à la fois la génération et la vérification de réponses, ainsi que la robustesse à la mémorisation. Sa couverture de plusieurs domaines et niveaux de difficulté permet de comparer la capacité des modèles à produire des résultats exacts sur des exercices mathématiques exigeants.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind
Capacités mesuréesRaisonnement mathematique de niveau olympiade (IMO), robustesse a la memorisation, generation et verification de reponses
ModalitéTexte
Type de questionsProblemes mathematiques a reponse courte unique et verifiable
Métrique d'évaluationPrécision (autograding strict)
AccèsPublic
Languesanglais
Taille du jeu400 problemes (Algebre, Combinatoire, Geometrie, Theorie des nombres : 100 chacun), 4 niveaux de difficulte
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (19)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert92,3 %4 juin 2026Auto-déclaré
2GLM-5.2Zhipu AI🟢 Ouvert91,0 %16 juin 2026Auto-déclaré
3Hy3Tencent🟢 Ouvert90,0 %6 juillet 2026Auto-déclaré
4Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire90,0 %19 mai 2026Auto-déclaré
5DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert89,8 %23 avril 2026Auto-déclaré
6DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert88,4 %23 avril 2026Auto-déclaré
7Kimi K2.6Moonshot AI🟢 Ouvert86,0 %20 avril 2026Auto-déclaré
8Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire86,0 %31 mai 2026Auto-déclaré
9Step-3.5-FlashStepFun🟢 Ouvert85,4 %2 février 2026Auto-déclaré
10GLM-5.1Zhipu AI🟢 Ouvert83,8 %7 avril 2026Auto-déclaré
11Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire83,8 %31 mars 2026Auto-déclaré
12GLM-4.7Zhipu AI🟢 Ouvert82,0 %22 décembre 2025Auto-déclaré
13Kimi K2.5Moonshot AI🟢 Ouvert81,8 %27 janvier 2026Auto-déclaré
14Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert80,9 %16 février 2026Auto-déclaré
15Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert80,8 %21 avril 2026Auto-déclaré
16Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert78,9 %16 avril 2026Auto-déclaré
17Kimi K2 0905Moonshot AI🔒 Propriétaire78,6 %5 septembre 2025Auto-déclaré
18LongCat-Flash-Thinking-2601Meituan🟢 Ouvert78,6 %14 janvier 2026Auto-déclaré
19DeepSeek-V3.2DeepSeek🟢 Ouvert78,3 %1 décembre 2025Auto-déclaré

Classement établi sur 19 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 83,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur IMO-AnswerBench indique qu’un modèle fournit fréquemment la réponse exacte attendue à des problèmes de niveau olympiade. L’autograding strict renforce la rigueur de la correction en limitant l’ambiguïté liée à l’appréciation humaine. La fiabilité comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.

La médiane de 84 % parmi les 18 modèles évalués, face à un meilleur résultat de 92 % obtenu par Nemotron 3 Ultra (550B A55B), suggère une concentration des performances dans le haut de l’échelle et donc un risque de saturation. La robustesse à la mémorisation fait partie des capacités visées, ce qui répond à l’enjeu de contamination, sans élargir pour autant la portée du classement. Celui-ci mesure un cadre précis : des réponses courtes et vérifiables en algèbre, combinatoire, géométrie et théorie des nombres. Il renseigne donc sur l’exactitude dans ce format, pas sur l’ensemble des capacités mathématiques d’un modèle.


Sources des scores : llm-stats.