AIME 2026
AIME 2026 réunit les 30 problèmes des épreuves AIME I et AIME II conçues par la Mathematical Association of America. Ces questions ouvertes, issues des mathématiques de niveau olympiade, attendent une réponse entière courte et mobilisent des raisonnements complexes.
AIME 2026 réunit les 30 problèmes des épreuves AIME I et AIME II conçues par la Mathematical Association of America. Ces questions ouvertes, issues des mathématiques de niveau olympiade, attendent une réponse entière courte et mobilisent des raisonnements complexes.
Employé comme benchmark d’intelligence artificielle, cet ensemble évalue la capacité des modèles à enchaîner plusieurs étapes, effectuer des déductions logiques et organiser un calcul symbolique. La notation par correspondance exacte vérifie directement si chaque réponse finale est correcte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mathematical Association of America (MAA) |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte, avec réponse entière de 000 à 999 |
| Métrique d'évaluation | accuracy / exact match |
| Accès | Public |
| Licence | propriétaire |
| Langues | anglais |
| Taille du jeu | 30 problèmes |
| Année de publication | 2026 |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (17)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 99,2 % | 16 juin 2026 | Auto-déclaré |
| 2 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 96,4 % | 20 avril 2026 | Auto-déclaré |
| 3 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 95,3 % | 7 avril 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 95,3 % | 31 mars 2026 | Auto-déclaré |
| 5 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 94,5 % | 2 juin 2026 | Auto-déclaré |
| 6 | Seed 2.0 Pro | ByteDance | 🔒 Propriétaire | 94,2 % | 14 février 2026 | Auto-déclaré |
| 7 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,1 % | 21 avril 2026 | Auto-déclaré |
| 8 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,7 % | 16 avril 2026 | Auto-déclaré |
| 9 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 92,5 % | 2 juin 2026 | Auto-déclaré |
| 10 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,3 % | 16 février 2026 | Auto-déclaré |
| 11 | Gemma 4 31B | 🟢 Ouvert | 89,2 % | 2 avril 2026 | Auto-déclaré | |
| 12 | Gemma 4 26B-A4B | 🟢 Ouvert | 88,3 % | 2 avril 2026 | Auto-déclaré | |
| 13 | Seed 2.0 Lite | ByteDance | 🔒 Propriétaire | 88,3 % | 14 février 2026 | Auto-déclaré |
| 14 | Gemma 4 12B | 🟢 Ouvert | 77,5 % | 23 mai 2026 | Auto-déclaré | |
| 15 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 69,1 % | 10 juin 2026 | Auto-déclaré | |
| 16 | Gemma 4 E4B | 🟢 Ouvert | 42,5 % | 2 avril 2026 | Auto-déclaré | |
| 17 | Gemma 4 E2B | 🟢 Ouvert | 37,5 % | 2 avril 2026 | Auto-déclaré |
Classement établi sur 17 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 92,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AIME 2026 indique qu’un modèle fournit fréquemment la réponse entière exacte à des problèmes exigeant un raisonnement mathématique multi-étapes. Cette mesure reste stricte sur le résultat final, mais elle n’évalue pas directement la qualité de la démonstration produite. La fiabilité comparative doit aussi être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.
Avec une médiane de 92 % parmi les 17 modèles évalués et un meilleur résultat de 99 % pour GLM-5.2 de Zhipu AI, le classement montre un niveau globalement très élevé. Cette concentration près du maximum suggère une saturation du benchmark, qui réduit sa capacité à différencier finement les meilleurs modèles. Son accès public crée également un risque de contamination, les problèmes pouvant avoir été exposés aux systèmes évalués. Enfin, sa portée demeure spécialisée : il mesure la résolution de problèmes olympiques en anglais, avec réponses entières courtes, et non les capacités générales d’un modèle.
Sources des scores : llm-stats.