AIME 2026

AIME 2026 réunit les 30 problèmes des épreuves AIME I et AIME II conçues par la Mathematical Association of America. Ces questions ouvertes, issues des mathématiques de niveau olympiade, attendent une réponse entière courte et mobilisent des raisonnements complexes.

AIME 2026 réunit les 30 problèmes des épreuves AIME I et AIME II conçues par la Mathematical Association of America. Ces questions ouvertes, issues des mathématiques de niveau olympiade, attendent une réponse entière courte et mobilisent des raisonnements complexes.

Employé comme benchmark d’intelligence artificielle, cet ensemble évalue la capacité des modèles à enchaîner plusieurs étapes, effectuer des déductions logiques et organiser un calcul symbolique. La notation par correspondance exacte vérifie directement si chaque réponse finale est correcte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMathematical Association of America (MAA)
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte, avec réponse entière de 000 à 999
Métrique d'évaluationaccuracy / exact match
AccèsPublic
Licencepropriétaire
Languesanglais
Taille du jeu30 problèmes
Année de publication2026

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (17)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GLM-5.2Zhipu AI🟢 Ouvert99,2 %16 juin 2026Auto-déclaré
2Kimi K2.6Moonshot AI🟢 Ouvert96,4 %20 avril 2026Auto-déclaré
3GLM-5.1Zhipu AI🟢 Ouvert95,3 %7 avril 2026Auto-déclaré
4Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire95,3 %31 mars 2026Auto-déclaré
5MAI-Thinking-1Microsoft🔒 Propriétaire94,5 %2 juin 2026Auto-déclaré
6Seed 2.0 ProByteDance🔒 Propriétaire94,2 %14 février 2026Auto-déclaré
7Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert94,1 %21 avril 2026Auto-déclaré
8Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert92,7 %16 avril 2026Auto-déclaré
9MAI-Code-1-FlashMicrosoft🔒 Propriétaire92,5 %2 juin 2026Auto-déclaré
10Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert91,3 %16 février 2026Auto-déclaré
11Gemma 4 31BGoogle🟢 Ouvert89,2 %2 avril 2026Auto-déclaré
12Gemma 4 26B-A4BGoogle🟢 Ouvert88,3 %2 avril 2026Auto-déclaré
13Seed 2.0 LiteByteDance🔒 Propriétaire88,3 %14 février 2026Auto-déclaré
14Gemma 4 12BGoogle🟢 Ouvert77,5 %23 mai 2026Auto-déclaré
15DiffusionGemma 26B-A4BGoogle🟢 Ouvert69,1 %10 juin 2026Auto-déclaré
16Gemma 4 E4BGoogle🟢 Ouvert42,5 %2 avril 2026Auto-déclaré
17Gemma 4 E2BGoogle🟢 Ouvert37,5 %2 avril 2026Auto-déclaré

Classement établi sur 17 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 92,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur AIME 2026 indique qu’un modèle fournit fréquemment la réponse entière exacte à des problèmes exigeant un raisonnement mathématique multi-étapes. Cette mesure reste stricte sur le résultat final, mais elle n’évalue pas directement la qualité de la démonstration produite. La fiabilité comparative doit aussi être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.

Avec une médiane de 92 % parmi les 17 modèles évalués et un meilleur résultat de 99 % pour GLM-5.2 de Zhipu AI, le classement montre un niveau globalement très élevé. Cette concentration près du maximum suggère une saturation du benchmark, qui réduit sa capacité à différencier finement les meilleurs modèles. Son accès public crée également un risque de contamination, les problèmes pouvant avoir été exposés aux systèmes évalués. Enfin, sa portée demeure spécialisée : il mesure la résolution de problèmes olympiques en anglais, avec réponses entières courtes, et non les capacités générales d’un modèle.


Sources des scores : llm-stats.