AIME 2024
AIME 2024 est un benchmark issu de l’American Invitational Mathematics Examination, créé par la Mathematical Association of America dans le cadre des American Mathematics Competitions. Il réunit des problèmes exigeants provenant des compétitions AIME I et AIME II.
AIME 2024 est un benchmark issu de l’American Invitational Mathematics Examination, créé par la Mathematical Association of America dans le cadre des American Mathematics Competitions. Il réunit des problèmes exigeants provenant des compétitions AIME I et AIME II.
Le benchmark évalue le raisonnement mathématique avancé de niveau olympiade en algèbre, géométrie, combinatoire et théorie des nombres. Ses questions ouvertes imposent une réponse entière exacte, ce qui en fait un outil d’évaluation des capacités de résolution des grands modèles de langage.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mathematical Association of America (MAA) / American Mathematics Competitions (AMC) |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte, avec réponse entière entre 0 et 999 |
| Métrique d'évaluation | accuracy / exact match |
| Accès | Public |
| Licence | propriétaire |
| Langues | anglais |
| Taille du jeu | 30 questions |
| Année de publication | 2024 |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (52)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Grok-3 Mini | xAI | 🔒 Propriétaire | 95,8 % | 17 février 2025 | Auto-déclaré |
| 2 | o4-mini | OpenAI | 🔒 Propriétaire | 93,4 % | 16 avril 2025 | Auto-déclaré |
| 3 | Grok-3 | xAI | 🔒 Propriétaire | 93,3 % | 17 février 2025 | Auto-déclaré |
| 4 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 93,3 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Gemini 2.5 Pro | 🔒 Propriétaire | 92,0 % | 20 mai 2025 | Auto-déclaré | |
| 6 | o3 | OpenAI | 🔒 Propriétaire | 91,6 % | 16 avril 2025 | Auto-déclaré |
| 7 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 91,4 % | 28 mai 2025 | Auto-déclaré |
| 8 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 91,0 % | 28 juillet 2025 | Auto-déclaré |
| 9 | Ministral 3 (14B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 89,8 % | 4 décembre 2025 | Auto-déclaré |
| 10 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 89,4 % | 28 juillet 2025 | Auto-déclaré |
| 11 | Gemini 2.5 Flash | 🔒 Propriétaire | 88,0 % | 20 mai 2025 | Auto-déclaré | |
| 12 | o3-mini | OpenAI | 🔒 Propriétaire | 87,3 % | 30 janvier 2025 | Auto-déclaré |
| 13 | DeepSeek R1 Distill Llama 70B | DeepSeek | 🟢 Ouvert | 86,7 % | 20 janvier 2025 | Auto-déclaré |
| 14 | DeepSeek R1 Zero | DeepSeek | 🟢 Ouvert | 86,7 % | 20 janvier 2025 | Auto-déclaré |
| 15 | Ministral 3 (8B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 86,0 % | 4 décembre 2025 | Auto-déclaré |
| 16 | o1-pro | OpenAI | 🔒 Propriétaire | 86,0 % | 17 décembre 2024 | Auto-déclaré |
| 17 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,7 % | 29 avril 2025 | Auto-déclaré |
| 18 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 83,8 % | 11 février 2026 | Auto-déclaré |
| 19 | DeepSeek R1 Distill Qwen 32B | DeepSeek | 🟢 Ouvert | 83,3 % | 20 janvier 2025 | Auto-déclaré |
| 20 | DeepSeek R1 Distill Qwen 7B | DeepSeek | 🟢 Ouvert | 83,3 % | 20 janvier 2025 | Auto-déclaré |
| 21 | MiniMax M1 | MiniMax | 🟢 Ouvert | 83,3 % | 17 juin 2025 | Auto-déclaré |
| 22 | Qwen3 32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,4 % | 29 avril 2025 | Auto-déclaré |
| 23 | Phi 4 Reasoning Plus | Microsoft | 🟢 Ouvert | 81,3 % | 30 avril 2025 | Auto-déclaré |
| 24 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 81,2 % | 16 avril 2025 | Auto-déclaré |
| 25 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 81,2 % | 16 avril 2025 | Auto-déclaré |
| 26 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,4 % | 29 avril 2025 | Auto-déclaré |
| 27 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 80,0 % | 24 février 2025 | Auto-déclaré |
| 28 | DeepSeek R1 Distill Llama 8B | DeepSeek | 🟢 Ouvert | 80,0 % | 20 janvier 2025 | Auto-déclaré |
| 29 | DeepSeek R1 Distill Qwen 14B | DeepSeek | 🟢 Ouvert | 80,0 % | 20 janvier 2025 | Auto-déclaré |
| 30 | QwQ-32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,5 % | 5 mars 2025 | Auto-déclaré |
| 31 | Kimi-k1.5 | Moonshot AI | 🔒 Propriétaire | 77,5 % | 20 janvier 2025 | Auto-déclaré |
| 32 | Min istral 3 (3B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 77,5 % | 4 décembre 2025 | Auto-déclaré |
| 33 | Phi 4 Reasoning | Microsoft | 🟢 Ouvert | 75,3 % | 30 avril 2025 | Auto-déclaré |
| 34 | o1 | OpenAI | 🔒 Propriétaire | 74,3 % | 17 décembre 2024 | Auto-déclaré |
| 35 | Magistral Medium | Mistral AI | 🟢 Ouvert | 73,6 % | 10 juin 2025 | Auto-déclaré |
| 36 | Gemini 2.0 Flash | 🔒 Propriétaire | 73,3 % | 21 janvier 2025 | Auto-déclaré | |
| 37 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 72,2 % | 5 février 2026 | Auto-déclaré |
| 38 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 72,0 % | 5 septembre 2025 | Auto-déclaré |
| 39 | Magistral Small 2506 | Mistral AI | 🟢 Ouvert | 70,7 % | 10 juin 2025 | Auto-déclaré |
| 40 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 69,6 % | 11 juillet 2025 | Auto-déclaré |
| 41 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 69,6 % | 5 septembre 2025 | Auto-déclaré |
| 42 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 66,3 % | 10 janvier 2025 | Auto-déclaré |
| 43 | DeepSeek-V3 0324 | DeepSeek | 🟢 Ouvert | 59,4 % | 25 mars 2025 | Auto-déclaré |
| 44 | DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 🟢 Ouvert | 52,7 % | 20 janvier 2025 | Auto-déclaré |
| 45 | QwQ-32B-Preview | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,0 % | 28 novembre 2024 | Auto-déclaré |
| 46 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 49,6 % | 14 avril 2025 | Auto-déclaré |
| 47 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 48,1 % | 14 avril 2025 | Auto-déclaré |
| 48 | o1-preview | OpenAI | 🔒 Propriétaire | 42,0 % | 12 septembre 2024 | Auto-déclaré |
| 49 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 39,2 % | 25 décembre 2024 | Auto-déclaré |
| 50 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 36,7 % | 5 mars 2026 | Auto-déclaré |
| 51 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 29,4 % | 14 avril 2025 | Auto-déclaré |
| 52 | GPT-4o | OpenAI | 🔒 Propriétaire | 13,1 % | 27 mars 2025 | Auto-déclaré |
Classement établi sur 52 modèles évalués, dont 35 de grands éditeurs. Score médian de l'ensemble : 80,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AIME 2024 indique qu’un modèle résout correctement une forte proportion de problèmes mathématiques avancés et produit précisément l’entier attendu. L’exact match impose une validation stricte du résultat final, sans crédit partiel pour une démarche pertinente mais inaboutie. La comparaison doit toutefois rester prudente, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.
Le niveau médian de 80 % parmi les 52 modèles évalués, ainsi que le score de 96 % obtenu par Grok-3 Mini, signalent une forte concentration des performances vers le haut. Cette proximité avec le maximum réduit progressivement la capacité du benchmark à départager les meilleurs modèles. Son accès public crée aussi une possibilité de contamination des évaluations. Enfin, sa portée demeure ciblée sur 30 problèmes en anglais, à réponse entière courte, dans quatre domaines mathématiques. Le classement révèle donc surtout la maîtrise de ce format olympiade précis, et non une capacité générale couvrant toutes les formes de raisonnement mathématique.
Sources des scores : llm-stats.