AIME 2025

AIME 2025 rassemble les problèmes des deux éditions 2025 de l’American Invitational Mathematics Examination, conçu par la Mathematical Association of America. Ce benchmark repose sur des questions ouvertes de niveau olympiade, dont la résolution exige plusieurs étapes de raisonnement.

AIME 2025 rassemble les problèmes des deux éditions 2025 de l’American Invitational Mathematics Examination, conçu par la Mathematical Association of America. Ce benchmark repose sur des questions ouvertes de niveau olympiade, dont la résolution exige plusieurs étapes de raisonnement.

Utilisé pour évaluer les grands modèles de langage, il mesure leur aptitude à enchaîner des déductions logiques, à manipuler des expressions symboliques de façon structurée et à produire une réponse entière exacte. Il constitue ainsi un test ciblé de résolution mathématique complexe.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMathematical Association of America (MAA)
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte, avec réponse entière de 000 à 999
Métrique d'évaluationexact match / accuracy
AccèsPublic
Licencepropriétaire
Languesanglais
Taille du jeu30 problèmes
Année de publication2025

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (108)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.2OpenAI🔒 Propriétaire100,0 %11 décembre 2025Auto-déclaré
2GPT-5.2 ProOpenAI🔒 Propriétaire100,0 %11 décembre 2025Auto-déclaré
3Gemini 3 ProGoogle🔒 Propriétaire100,0 %18 novembre 2025Auto-déclaré
4Grok-4 HeavyxAI🔒 Propriétaire100,0 %Auto-déclaré
5Kimi K2 0905Moonshot AI🔒 Propriétaire100,0 %5 septembre 2025Auto-déclaré
6Claude Opus 4.6Anthropic🔒 Propriétaire99,8 %5 février 2026Auto-déclaré
7Gemini 3 FlashGoogle🔒 Propriétaire99,7 %17 décembre 2025Auto-déclaré
8LongCat-Flash-Thinking-2601Meituan🟢 Ouvert99,6 %14 janvier 2026Auto-déclaré
9Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert99,2 %15 décembre 2025Auto-déclaré
10GPT OSS 20BOpenAI🟢 Ouvert98,7 %5 août 2025Auto-déclaré
11Seed 2.0 ProByteDance🔒 Propriétaire98,3 %14 février 2026Auto-déclaré
12Step-3.5-FlashStepFun🟢 Ouvert97,3 %2 février 2026Auto-déclaré
13MAI-Thinking-1Microsoft🔒 Propriétaire97,0 %2 juin 2026Auto-déclaré
14GPT-5.1 CodexOpenAI🔒 Propriétaire96,7 %19 novembre 2025Auto-déclaré
15Sarvam-105BSarvam AI🟢 Ouvert96,7 %6 mars 2026Auto-déclaré
16Sarvam-30BSarvam AI🟢 Ouvert96,7 %6 mars 2026Auto-déclaré
17Kimi K2.5Moonshot AI🟢 Ouvert96,1 %27 janvier 2026Auto-déclaré
18DeepSeek-V3.2-SpecialeDeepSeek🟢 Ouvert96,0 %1 décembre 2025Auto-déclaré
19GLM-4.7Zhipu AI🟢 Ouvert95,7 %22 décembre 2025Auto-déclaré
20GPT-5OpenAI🔒 Propriétaire94,6 %7 août 2025Auto-déclaré
21MiMo-V2-FlashXiaomi🟢 Ouvert94,1 %16 décembre 2025Auto-déclaré
22GPT-5.1OpenAI🔒 Propriétaire94,0 %13 novembre 2025Auto-déclaré
23GPT-5.1 InstantOpenAI🔒 Propriétaire94,0 %12 novembre 2025Auto-déclaré
24GLM-4.6Zhipu AI🟢 Ouvert93,9 %30 septembre 2025Auto-déclaré
25Grok-3xAI🔒 Propriétaire93,3 %17 février 2025Auto-déclaré
26DeepSeek-V3.2DeepSeek🟢 Ouvert93,1 %1 décembre 2025Auto-déclaré
27DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert93,1 %1 décembre 2025Auto-déclaré
28Seed 2.0 LiteByteDance🔒 Propriétaire93,0 %14 février 2026Auto-déclaré
29K-EXAONE-236B-A23BLG AI Research🔒 Propriétaire92,8 %31 décembre 2025Auto-déclaré
30o4-miniOpenAI🔒 Propriétaire92,7 %16 avril 2025Auto-déclaré
31GPT OSS 120BOpenAI🟢 Ouvert92,5 %5 août 2025Auto-déclaré
32Nova 2 ProAmazon🔒 Propriétaire92,3 %2 décembre 2025Auto-déclaré
33Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert92,3 %25 juillet 2025Auto-déclaré
34Nova 2 OmniAmazon🔒 Propriétaire92,1 %2 décembre 2025Auto-déclaré
35Grok 4 FastxAI🔒 Propriétaire92,0 %28 août 2025Auto-déclaré
36Grok-4xAI🔒 Propriétaire91,7 %9 juillet 2025Auto-déclaré
37GLM-4.7-FlashZhipu AI🟢 Ouvert91,6 %19 janvier 2026Auto-déclaré
38GPT-5 miniOpenAI🔒 Propriétaire91,1 %7 août 2025Auto-déclaré
39Mercury 2Inception🔒 Propriétaire91,1 %24 février 2026Auto-déclaré
40Nova 2 LiteAmazon🔒 Propriétaire91,0 %2 décembre 2025Auto-déclaré
41Grok-3 MinixAI🔒 Propriétaire90,8 %17 février 2025Auto-déclaré
42LongCat-Flash-ThinkingMeituan🟢 Ouvert90,6 %22 septembre 2025Auto-déclaré
43Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert90,2 %11 mars 2026Auto-déclaré
44Command A+Cohere🟢 Ouvert90,0 %20 mai 2026Auto-déclaré
45Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert89,7 %22 septembre 2025Auto-déclaré
46DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert89,3 %29 septembre 2025Auto-déclaré
47Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire88,0 %5 juin 2025Auto-déclaré
48Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert87,8 %10 septembre 2025Auto-déclaré
49Step3-VL-10BStepFun🟢 Ouvert87,7 %15 janvier 2026Auto-déclaré
50DeepSeek-R1-0528DeepSeek🟢 Ouvert87,5 %28 mai 2025Auto-déclaré
51Claude Sonnet 4.5Anthropic🔒 Propriétaire87,0 %29 septembre 2025Auto-déclaré
52ERNIE 5.0Baidu🔒 Propriétaire87,0 %22 janvier 2026Auto-déclaré
53o3OpenAI🔒 Propriétaire86,4 %16 avril 2025Auto-déclaré
54Mistral Medium 3.5Mistral AI🟢 Ouvert86,3 %29 avril 2026Auto-déclaré
55GPT-5 nanoOpenAI🔒 Propriétaire85,2 %7 août 2025Auto-déclaré
56Ministral 3 (14B Reasoning 2512)Mistral AI🟢 Ouvert85,0 %4 décembre 2025Auto-déclaré
57Mistral Small 4Mistral AI🟢 Ouvert83,8 %16 mars 2026Auto-déclaré
58Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert83,7 %22 septembre 2025Auto-déclaré
59Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert83,1 %22 septembre 2025Auto-déclaré
60Gemini 2.5 ProGoogle🔒 Propriétaire83,0 %20 mai 2025Auto-déclaré
61Qwen3 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire81,6 %15 décembre 2025Auto-déclaré
62Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert81,5 %29 avril 2025Auto-déclaré
63GPT-5.5 InstantOpenAI🔒 Propriétaire81,2 %5 mai 2026Auto-déclaré
64MiniMax M2.1MiniMax🟢 Ouvert81,0 %23 décembre 2025Auto-déclaré
65Claude Haiku 4.5Anthropic🔒 Propriétaire80,7 %15 octobre 2025Auto-déclaré
66Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert80,3 %22 septembre 2025Auto-déclaré
67Ministral 3 (8B Reasoning 2512)Mistral AI🟢 Ouvert78,7 %4 décembre 2025Auto-déclaré
68MiniCPM-SALAOpenBMB🟢 Ouvert78,3 %11 février 2026Auto-déclaré
69Claude Opus 4.1Anthropic🔒 Propriétaire78,0 %5 août 2025Auto-déclaré
70MiniMax M2MiniMax🟢 Ouvert78,0 %27 octobre 2025Auto-déclaré
71Phi 4 Reasoning PlusMicrosoft🟢 Ouvert78,0 %30 avril 2025Auto-déclaré
72Claude Opus 4Anthropic🔒 Propriétaire75,5 %22 mai 2025Auto-déclaré
73Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,7 %22 septembre 2025Auto-déclaré
74MiniMax M1MiniMax🟢 Ouvert74,6 %17 juin 2025Auto-déclaré
75Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert74,5 %22 septembre 2025Auto-déclaré
76Qwen3 32BAlibaba Cloud / Qwen Team🟢 Ouvert72,9 %29 avril 2025Auto-déclaré
77Llama 3.1 Nemotron Ultra 253B v1NVIDIA🟢 Ouvert72,5 %7 avril 2025Auto-déclaré
78Min istral 3 (3B Reasoning 2512)Mistral AI🟢 Ouvert72,1 %4 décembre 2025Auto-déclaré
79Nemotron Nano 9B v2NVIDIA🟢 Ouvert72,1 %18 août 2025Auto-déclaré
80Gemini 2.5 FlashGoogle🔒 Propriétaire72,0 %20 mai 2025Auto-déclaré
81Qwen3 30B A3BAlibaba Cloud / Qwen Team🟢 Ouvert70,9 %29 avril 2025Auto-déclaré
82Claude Sonnet 4Anthropic🔒 Propriétaire70,5 %22 mai 2025Auto-déclaré
83Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert70,3 %22 juillet 2025Auto-déclaré
84Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,5 %10 septembre 2025Auto-déclaré
85Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,3 %22 septembre 2025Auto-déclaré
86Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert66,2 %22 septembre 2025Auto-déclaré
87Magistral MediumMistral AI🟢 Ouvert64,9 %10 juin 2025Auto-déclaré
88LongCat-Flash-LiteMeituan🟢 Ouvert63,2 %5 février 2026Auto-déclaré
89Phi 4 ReasoningMicrosoft🟢 Ouvert62,9 %30 avril 2025Auto-déclaré
90Magistral Small 2506Mistral AI🟢 Ouvert62,8 %10 juin 2025Auto-déclaré
91LongCat-Flash-ChatMeituan🟢 Ouvert61,3 %29 août 2025Auto-déclaré
92Llama-3.3 Nemotron Super 49B v1NVIDIA🟢 Ouvert58,4 %18 mars 2025Auto-déclaré
93Claude 3.7 SonnetAnthropic🔒 Propriétaire54,8 %24 février 2025Auto-déclaré
94DeepSeek-V3.1DeepSeek🟢 Ouvert49,8 %10 janvier 2025Auto-déclaré
95Gemini 2.5 Flash-LiteGoogle🟢 Ouvert49,8 %17 juin 2025Auto-déclaré
96Kimi K2 InstructMoonshot AI🟢 Ouvert49,5 %11 juillet 2025Auto-déclaré
97Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert49,5 %5 septembre 2025Auto-déclaré
98Llama 3.1 Nemotron Nano 8B V1NVIDIA🟢 Ouvert47,1 %18 mars 2025Auto-déclaré
99Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert46,6 %22 septembre 2025Auto-déclaré
100GPT-4.1OpenAI🔒 Propriétaire46,4 %14 avril 2025Auto-déclaré
101Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert45,9 %22 septembre 2025Auto-déclaré
102GPT-5.1 Codex MiniOpenAI🔒 Propriétaire42,1 %12 novembre 2025Auto-déclaré
103GPT-4.1 miniOpenAI🔒 Propriétaire40,2 %14 avril 2025Auto-déclaré
104Gemini DiffusionGoogle🔒 Propriétaire23,3 %20 mai 2025Auto-déclaré
105Gemma 3n E4B InstructedGoogle🔒 Propriétaire11,6 %26 juin 2025Auto-déclaré
106Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert11,6 %20 mai 2025Auto-déclaré
107Gemma 3n E2B InstructedGoogle🔒 Propriétaire6,7 %26 juin 2025Auto-déclaré
108Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert6,7 %20 mai 2025Auto-déclaré

Classement établi sur 108 modèles évalués, dont 64 de grands éditeurs. Score médian de l'ensemble : 85,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur AIME 2025 indique qu’un modèle résout correctement une forte proportion de problèmes exigeant des déductions multi-étapes et une manipulation symbolique structurée. La métrique exact match impose de fournir précisément la réponse entière attendue, sans crédit partiel. La lecture des résultats doit toutefois tenir compte de leur fiabilité, puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.

Le classement montre un niveau global élevé parmi les 108 modèles recensés, avec une médiane de 86 % et GPT-5.2 en tête à 100 %. Ce plafond atteint signale une saturation possible pour les meilleurs systèmes et réduit la capacité du benchmark à les départager. L’accès public aux problèmes crée aussi un risque de contamination des évaluations, sans établir qu’elle a effectivement eu lieu. Enfin, sa portée reste ciblée sur 30 problèmes en anglais, issus d’une compétition mathématique de niveau olympiade. Les résultats renseignent donc précisément le raisonnement mathématique évalué, mais pas les capacités générales d’un modèle.


Sources des scores : llm-stats.