IMO-AnswerBench
IMO-AnswerBench est un benchmark public conçu par Google DeepMind pour évaluer le raisonnement mathématique de niveau olympiade. Il repose sur des problèmes inspirés de l’International Mathematical Olympiad, formulés en anglais et associés à une réponse courte, unique et vérifiable.
IMO-AnswerBench est un benchmark public conçu par Google DeepMind pour évaluer le raisonnement mathématique de niveau olympiade. Il repose sur des problèmes inspirés de l’International Mathematical Olympiad, formulés en anglais et associés à une réponse courte, unique et vérifiable.
Le benchmark examine à la fois la génération et la vérification de réponses, ainsi que la robustesse à la mémorisation. Sa couverture de plusieurs domaines et niveaux de difficulté permet de comparer la capacité des modèles à produire des résultats exacts sur des exercices mathématiques exigeants.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind |
| Capacités mesurées | Raisonnement mathematique de niveau olympiade (IMO), robustesse a la memorisation, generation et verification de reponses |
| Modalité | Texte |
| Type de questions | Problemes mathematiques a reponse courte unique et verifiable |
| Métrique d'évaluation | Précision (autograding strict) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 400 problemes (Algebre, Combinatoire, Geometrie, Theorie des nombres : 100 chacun), 4 niveaux de difficulte |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (19)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 92,3 % | 4 juin 2026 | Auto-déclaré |
| 2 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 91,0 % | 16 juin 2026 | Auto-déclaré |
| 3 | Hy3 | Tencent | 🟢 Ouvert | 90,0 % | 6 juillet 2026 | Auto-déclaré |
| 4 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 90,0 % | 19 mai 2026 | Auto-déclaré |
| 5 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 89,8 % | 23 avril 2026 | Auto-déclaré |
| 6 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 88,4 % | 23 avril 2026 | Auto-déclaré |
| 7 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 86,0 % | 20 avril 2026 | Auto-déclaré |
| 8 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 86,0 % | 31 mai 2026 | Auto-déclaré |
| 9 | Step-3.5-Flash | StepFun | 🟢 Ouvert | 85,4 % | 2 février 2026 | Auto-déclaré |
| 10 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 83,8 % | 7 avril 2026 | Auto-déclaré |
| 11 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 83,8 % | 31 mars 2026 | Auto-déclaré |
| 12 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 82,0 % | 22 décembre 2025 | Auto-déclaré |
| 13 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 81,8 % | 27 janvier 2026 | Auto-déclaré |
| 14 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,9 % | 16 février 2026 | Auto-déclaré |
| 15 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,8 % | 21 avril 2026 | Auto-déclaré |
| 16 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,9 % | 16 avril 2026 | Auto-déclaré |
| 17 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 78,6 % | 5 septembre 2025 | Auto-déclaré |
| 18 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 78,6 % | 14 janvier 2026 | Auto-déclaré |
| 19 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 78,3 % | 1 décembre 2025 | Auto-déclaré |
Classement établi sur 19 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 83,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur IMO-AnswerBench indique qu’un modèle fournit fréquemment la réponse exacte attendue à des problèmes de niveau olympiade. L’autograding strict renforce la rigueur de la correction en limitant l’ambiguïté liée à l’appréciation humaine. La fiabilité comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.
La médiane de 84 % parmi les 18 modèles évalués, face à un meilleur résultat de 92 % obtenu par Nemotron 3 Ultra (550B A55B), suggère une concentration des performances dans le haut de l’échelle et donc un risque de saturation. La robustesse à la mémorisation fait partie des capacités visées, ce qui répond à l’enjeu de contamination, sans élargir pour autant la portée du classement. Celui-ci mesure un cadre précis : des réponses courtes et vérifiables en algèbre, combinatoire, géométrie et théorie des nombres. Il renseigne donc sur l’exactitude dans ce format, pas sur l’ensemble des capacités mathématiques d’un modèle.
Sources des scores : llm-stats.