AIME 2024

AIME 2024 est un benchmark issu de l’American Invitational Mathematics Examination, créé par la Mathematical Association of America dans le cadre des American Mathematics Competitions. Il réunit des problèmes exigeants provenant des compétitions AIME I et AIME II.

AIME 2024 est un benchmark issu de l’American Invitational Mathematics Examination, créé par la Mathematical Association of America dans le cadre des American Mathematics Competitions. Il réunit des problèmes exigeants provenant des compétitions AIME I et AIME II.

Le benchmark évalue le raisonnement mathématique avancé de niveau olympiade en algèbre, géométrie, combinatoire et théorie des nombres. Ses questions ouvertes imposent une réponse entière exacte, ce qui en fait un outil d’évaluation des capacités de résolution des grands modèles de langage.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMathematical Association of America (MAA) / American Mathematics Competitions (AMC)
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte, avec réponse entière entre 0 et 999
Métrique d'évaluationaccuracy / exact match
AccèsPublic
Licencepropriétaire
Languesanglais
Taille du jeu30 questions
Année de publication2024

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (52)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Grok-3 MinixAI🔒 Propriétaire95,8 %17 février 2025Auto-déclaré
2o4-miniOpenAI🔒 Propriétaire93,4 %16 avril 2025Auto-déclaré
3Grok-3xAI🔒 Propriétaire93,3 %17 février 2025Auto-déclaré
4LongCat-Flash-ThinkingMeituan🟢 Ouvert93,3 %22 septembre 2025Auto-déclaré
5Gemini 2.5 ProGoogle🔒 Propriétaire92,0 %20 mai 2025Auto-déclaré
6o3OpenAI🔒 Propriétaire91,6 %16 avril 2025Auto-déclaré
7DeepSeek-R1-0528DeepSeek🟢 Ouvert91,4 %28 mai 2025Auto-déclaré
8GLM-4.5Zhipu AI🟢 Ouvert91,0 %28 juillet 2025Auto-déclaré
9Ministral 3 (14B Reasoning 2512)Mistral AI🟢 Ouvert89,8 %4 décembre 2025Auto-déclaré
10GLM-4.5-AirZhipu AI🟢 Ouvert89,4 %28 juillet 2025Auto-déclaré
11Gemini 2.5 FlashGoogle🔒 Propriétaire88,0 %20 mai 2025Auto-déclaré
12o3-miniOpenAI🔒 Propriétaire87,3 %30 janvier 2025Auto-déclaré
13DeepSeek R1 Distill Llama 70BDeepSeek🟢 Ouvert86,7 %20 janvier 2025Auto-déclaré
14DeepSeek R1 ZeroDeepSeek🟢 Ouvert86,7 %20 janvier 2025Auto-déclaré
15Ministral 3 (8B Reasoning 2512)Mistral AI🟢 Ouvert86,0 %4 décembre 2025Auto-déclaré
16o1-proOpenAI🔒 Propriétaire86,0 %17 décembre 2024Auto-déclaré
17Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert85,7 %29 avril 2025Auto-déclaré
18MiniCPM-SALAOpenBMB🟢 Ouvert83,8 %11 février 2026Auto-déclaré
19DeepSeek R1 Distill Qwen 32BDeepSeek🟢 Ouvert83,3 %20 janvier 2025Auto-déclaré
20DeepSeek R1 Distill Qwen 7BDeepSeek🟢 Ouvert83,3 %20 janvier 2025Auto-déclaré
21MiniMax M1MiniMax🟢 Ouvert83,3 %17 juin 2025Auto-déclaré
22Qwen3 32BAlibaba Cloud / Qwen Team🟢 Ouvert81,4 %29 avril 2025Auto-déclaré
23Phi 4 Reasoning PlusMicrosoft🟢 Ouvert81,3 %30 avril 2025Auto-déclaré
24Granite 3.3 8B BaseIBM🟢 Ouvert81,2 %16 avril 2025Auto-déclaré
25Granite 3.3 8B InstructIBM🟢 Ouvert81,2 %16 avril 2025Auto-déclaré
26Qwen3 30B A3BAlibaba Cloud / Qwen Team🟢 Ouvert80,4 %29 avril 2025Auto-déclaré
27Claude 3.7 SonnetAnthropic🔒 Propriétaire80,0 %24 février 2025Auto-déclaré
28DeepSeek R1 Distill Llama 8BDeepSeek🟢 Ouvert80,0 %20 janvier 2025Auto-déclaré
29DeepSeek R1 Distill Qwen 14BDeepSeek🟢 Ouvert80,0 %20 janvier 2025Auto-déclaré
30QwQ-32BAlibaba Cloud / Qwen Team🟢 Ouvert79,5 %5 mars 2025Auto-déclaré
31Kimi-k1.5Moonshot AI🔒 Propriétaire77,5 %20 janvier 2025Auto-déclaré
32Min istral 3 (3B Reasoning 2512)Mistral AI🟢 Ouvert77,5 %4 décembre 2025Auto-déclaré
33Phi 4 ReasoningMicrosoft🟢 Ouvert75,3 %30 avril 2025Auto-déclaré
34o1OpenAI🔒 Propriétaire74,3 %17 décembre 2024Auto-déclaré
35Magistral MediumMistral AI🟢 Ouvert73,6 %10 juin 2025Auto-déclaré
36Gemini 2.0 FlashGoogle🔒 Propriétaire73,3 %21 janvier 2025Auto-déclaré
37LongCat-Flash-LiteMeituan🟢 Ouvert72,2 %5 février 2026Auto-déclaré
38Kimi K2 0905Moonshot AI🔒 Propriétaire72,0 %5 septembre 2025Auto-déclaré
39Magistral Small 2506Mistral AI🟢 Ouvert70,7 %10 juin 2025Auto-déclaré
40Kimi K2 InstructMoonshot AI🟢 Ouvert69,6 %11 juillet 2025Auto-déclaré
41Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert69,6 %5 septembre 2025Auto-déclaré
42DeepSeek-V3.1DeepSeek🟢 Ouvert66,3 %10 janvier 2025Auto-déclaré
43DeepSeek-V3 0324DeepSeek🟢 Ouvert59,4 %25 mars 2025Auto-déclaré
44DeepSeek R1 Distill Qwen 1.5BDeepSeek🟢 Ouvert52,7 %20 janvier 2025Auto-déclaré
45QwQ-32B-PreviewAlibaba Cloud / Qwen Team🟢 Ouvert50,0 %28 novembre 2024Auto-déclaré
46GPT-4.1 miniOpenAI🔒 Propriétaire49,6 %14 avril 2025Auto-déclaré
47GPT-4.1OpenAI🔒 Propriétaire48,1 %14 avril 2025Auto-déclaré
48o1-previewOpenAI🔒 Propriétaire42,0 %12 septembre 2024Auto-déclaré
49DeepSeek-V3DeepSeek🟢 Ouvert39,2 %25 décembre 2024Auto-déclaré
50GPT-4.5OpenAI🔒 Propriétaire36,7 %5 mars 2026Auto-déclaré
51GPT-4.1 nanoOpenAI🔒 Propriétaire29,4 %14 avril 2025Auto-déclaré
52GPT-4oOpenAI🔒 Propriétaire13,1 %27 mars 2025Auto-déclaré

Classement établi sur 52 modèles évalués, dont 35 de grands éditeurs. Score médian de l'ensemble : 80,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur AIME 2024 indique qu’un modèle résout correctement une forte proportion de problèmes mathématiques avancés et produit précisément l’entier attendu. L’exact match impose une validation stricte du résultat final, sans crédit partiel pour une démarche pertinente mais inaboutie. La comparaison doit toutefois rester prudente, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.

Le niveau médian de 80 % parmi les 52 modèles évalués, ainsi que le score de 96 % obtenu par Grok-3 Mini, signalent une forte concentration des performances vers le haut. Cette proximité avec le maximum réduit progressivement la capacité du benchmark à départager les meilleurs modèles. Son accès public crée aussi une possibilité de contamination des évaluations. Enfin, sa portée demeure ciblée sur 30 problèmes en anglais, à réponse entière courte, dans quatre domaines mathématiques. Le classement révèle donc surtout la maîtrise de ce format olympiade précis, et non une capacité générale couvrant toutes les formes de raisonnement mathématique.


Sources des scores : llm-stats.