AIME 2025
AIME 2025 rassemble les problèmes des deux éditions 2025 de l’American Invitational Mathematics Examination, conçu par la Mathematical Association of America. Ce benchmark repose sur des questions ouvertes de niveau olympiade, dont la résolution exige plusieurs étapes de raisonnement.
AIME 2025 rassemble les problèmes des deux éditions 2025 de l’American Invitational Mathematics Examination, conçu par la Mathematical Association of America. Ce benchmark repose sur des questions ouvertes de niveau olympiade, dont la résolution exige plusieurs étapes de raisonnement.
Utilisé pour évaluer les grands modèles de langage, il mesure leur aptitude à enchaîner des déductions logiques, à manipuler des expressions symboliques de façon structurée et à produire une réponse entière exacte. Il constitue ainsi un test ciblé de résolution mathématique complexe.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mathematical Association of America (MAA) |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte, avec réponse entière de 000 à 999 |
| Métrique d'évaluation | exact match / accuracy |
| Accès | Public |
| Licence | propriétaire |
| Langues | anglais |
| Taille du jeu | 30 problèmes |
| Année de publication | 2025 |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (108)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 100,0 % | 11 décembre 2025 | Auto-déclaré |
| 2 | GPT-5.2 Pro | OpenAI | 🔒 Propriétaire | 100,0 % | 11 décembre 2025 | Auto-déclaré |
| 3 | Gemini 3 Pro | 🔒 Propriétaire | 100,0 % | 18 novembre 2025 | Auto-déclaré | |
| 4 | Grok-4 Heavy | xAI | 🔒 Propriétaire | 100,0 % | — | Auto-déclaré |
| 5 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 100,0 % | 5 septembre 2025 | Auto-déclaré |
| 6 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 99,8 % | 5 février 2026 | Auto-déclaré |
| 7 | Gemini 3 Flash | 🔒 Propriétaire | 99,7 % | 17 décembre 2025 | Auto-déclaré | |
| 8 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 99,6 % | 14 janvier 2026 | Auto-déclaré |
| 9 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 99,2 % | 15 décembre 2025 | Auto-déclaré |
| 10 | GPT OSS 20B | OpenAI | 🟢 Ouvert | 98,7 % | 5 août 2025 | Auto-déclaré |
| 11 | Seed 2.0 Pro | ByteDance | 🔒 Propriétaire | 98,3 % | 14 février 2026 | Auto-déclaré |
| 12 | Step-3.5-Flash | StepFun | 🟢 Ouvert | 97,3 % | 2 février 2026 | Auto-déclaré |
| 13 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 97,0 % | 2 juin 2026 | Auto-déclaré |
| 14 | GPT-5.1 Codex | OpenAI | 🔒 Propriétaire | 96,7 % | 19 novembre 2025 | Auto-déclaré |
| 15 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 96,7 % | 6 mars 2026 | Auto-déclaré |
| 16 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 96,7 % | 6 mars 2026 | Auto-déclaré |
| 17 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 96,1 % | 27 janvier 2026 | Auto-déclaré |
| 18 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 96,0 % | 1 décembre 2025 | Auto-déclaré |
| 19 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 95,7 % | 22 décembre 2025 | Auto-déclaré |
| 20 | GPT-5 | OpenAI | 🔒 Propriétaire | 94,6 % | 7 août 2025 | Auto-déclaré |
| 21 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 94,1 % | 16 décembre 2025 | Auto-déclaré |
| 22 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 94,0 % | 13 novembre 2025 | Auto-déclaré |
| 23 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 94,0 % | 12 novembre 2025 | Auto-déclaré |
| 24 | GLM-4.6 | Zhipu AI | 🟢 Ouvert | 93,9 % | 30 septembre 2025 | Auto-déclaré |
| 25 | Grok-3 | xAI | 🔒 Propriétaire | 93,3 % | 17 février 2025 | Auto-déclaré |
| 26 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 93,1 % | 1 décembre 2025 | Auto-déclaré |
| 27 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 93,1 % | 1 décembre 2025 | Auto-déclaré |
| 28 | Seed 2.0 Lite | ByteDance | 🔒 Propriétaire | 93,0 % | 14 février 2026 | Auto-déclaré |
| 29 | K-EXAONE-236B-A23B | LG AI Research | 🔒 Propriétaire | 92,8 % | 31 décembre 2025 | Auto-déclaré |
| 30 | o4-mini | OpenAI | 🔒 Propriétaire | 92,7 % | 16 avril 2025 | Auto-déclaré |
| 31 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 92,5 % | 5 août 2025 | Auto-déclaré |
| 32 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 92,3 % | 2 décembre 2025 | Auto-déclaré |
| 33 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,3 % | 25 juillet 2025 | Auto-déclaré |
| 34 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 92,1 % | 2 décembre 2025 | Auto-déclaré |
| 35 | Grok 4 Fast | xAI | 🔒 Propriétaire | 92,0 % | 28 août 2025 | Auto-déclaré |
| 36 | Grok-4 | xAI | 🔒 Propriétaire | 91,7 % | 9 juillet 2025 | Auto-déclaré |
| 37 | GLM-4.7-Flash | Zhipu AI | 🟢 Ouvert | 91,6 % | 19 janvier 2026 | Auto-déclaré |
| 38 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 91,1 % | 7 août 2025 | Auto-déclaré |
| 39 | Mercury 2 | Inception | 🔒 Propriétaire | 91,1 % | 24 février 2026 | Auto-déclaré |
| 40 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 91,0 % | 2 décembre 2025 | Auto-déclaré |
| 41 | Grok-3 Mini | xAI | 🔒 Propriétaire | 90,8 % | 17 février 2025 | Auto-déclaré |
| 42 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 90,6 % | 22 septembre 2025 | Auto-déclaré |
| 43 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 90,2 % | 11 mars 2026 | Auto-déclaré |
| 44 | Command A+ | Cohere | 🟢 Ouvert | 90,0 % | 20 mai 2026 | Auto-déclaré |
| 45 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,7 % | 22 septembre 2025 | Auto-déclaré |
| 46 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 89,3 % | 29 septembre 2025 | Auto-déclaré |
| 47 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 88,0 % | 5 juin 2025 | Auto-déclaré | |
| 48 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 10 septembre 2025 | Auto-déclaré |
| 49 | Step3-VL-10B | StepFun | 🟢 Ouvert | 87,7 % | 15 janvier 2026 | Auto-déclaré |
| 50 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 87,5 % | 28 mai 2025 | Auto-déclaré |
| 51 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 87,0 % | 29 septembre 2025 | Auto-déclaré |
| 52 | ERNIE 5.0 | Baidu | 🔒 Propriétaire | 87,0 % | 22 janvier 2026 | Auto-déclaré |
| 53 | o3 | OpenAI | 🔒 Propriétaire | 86,4 % | 16 avril 2025 | Auto-déclaré |
| 54 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 86,3 % | 29 avril 2026 | Auto-déclaré |
| 55 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 85,2 % | 7 août 2025 | Auto-déclaré |
| 56 | Ministral 3 (14B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 85,0 % | 4 décembre 2025 | Auto-déclaré |
| 57 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 83,8 % | 16 mars 2026 | Auto-déclaré |
| 58 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,7 % | 22 septembre 2025 | Auto-déclaré |
| 59 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,1 % | 22 septembre 2025 | Auto-déclaré |
| 60 | Gemini 2.5 Pro | 🔒 Propriétaire | 83,0 % | 20 mai 2025 | Auto-déclaré | |
| 61 | Qwen3 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 81,6 % | 15 décembre 2025 | Auto-déclaré |
| 62 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,5 % | 29 avril 2025 | Auto-déclaré |
| 63 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 81,2 % | 5 mai 2026 | Auto-déclaré |
| 64 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 81,0 % | 23 décembre 2025 | Auto-déclaré |
| 65 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 80,7 % | 15 octobre 2025 | Auto-déclaré |
| 66 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,3 % | 22 septembre 2025 | Auto-déclaré |
| 67 | Ministral 3 (8B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 78,7 % | 4 décembre 2025 | Auto-déclaré |
| 68 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 78,3 % | 11 février 2026 | Auto-déclaré |
| 69 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 78,0 % | 5 août 2025 | Auto-déclaré |
| 70 | MiniMax M2 | MiniMax | 🟢 Ouvert | 78,0 % | 27 octobre 2025 | Auto-déclaré |
| 71 | Phi 4 Reasoning Plus | Microsoft | 🟢 Ouvert | 78,0 % | 30 avril 2025 | Auto-déclaré |
| 72 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 75,5 % | 22 mai 2025 | Auto-déclaré |
| 73 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,7 % | 22 septembre 2025 | Auto-déclaré |
| 74 | MiniMax M1 | MiniMax | 🟢 Ouvert | 74,6 % | 17 juin 2025 | Auto-déclaré |
| 75 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,5 % | 22 septembre 2025 | Auto-déclaré |
| 76 | Qwen3 32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,9 % | 29 avril 2025 | Auto-déclaré |
| 77 | Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 🟢 Ouvert | 72,5 % | 7 avril 2025 | Auto-déclaré |
| 78 | Min istral 3 (3B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 72,1 % | 4 décembre 2025 | Auto-déclaré |
| 79 | Nemotron Nano 9B v2 | NVIDIA | 🟢 Ouvert | 72,1 % | 18 août 2025 | Auto-déclaré |
| 80 | Gemini 2.5 Flash | 🔒 Propriétaire | 72,0 % | 20 mai 2025 | Auto-déclaré | |
| 81 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,9 % | 29 avril 2025 | Auto-déclaré |
| 82 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 70,5 % | 22 mai 2025 | Auto-déclaré |
| 83 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 22 juillet 2025 | Auto-déclaré |
| 84 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,5 % | 10 septembre 2025 | Auto-déclaré |
| 85 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,3 % | 22 septembre 2025 | Auto-déclaré |
| 86 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,2 % | 22 septembre 2025 | Auto-déclaré |
| 87 | Magistral Medium | Mistral AI | 🟢 Ouvert | 64,9 % | 10 juin 2025 | Auto-déclaré |
| 88 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 63,2 % | 5 février 2026 | Auto-déclaré |
| 89 | Phi 4 Reasoning | Microsoft | 🟢 Ouvert | 62,9 % | 30 avril 2025 | Auto-déclaré |
| 90 | Magistral Small 2506 | Mistral AI | 🟢 Ouvert | 62,8 % | 10 juin 2025 | Auto-déclaré |
| 91 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 61,3 % | 29 août 2025 | Auto-déclaré |
| 92 | Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 🟢 Ouvert | 58,4 % | 18 mars 2025 | Auto-déclaré |
| 93 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 54,8 % | 24 février 2025 | Auto-déclaré |
| 94 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 49,8 % | 10 janvier 2025 | Auto-déclaré |
| 95 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 49,8 % | 17 juin 2025 | Auto-déclaré | |
| 96 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 49,5 % | 11 juillet 2025 | Auto-déclaré |
| 97 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 49,5 % | 5 septembre 2025 | Auto-déclaré |
| 98 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 🟢 Ouvert | 47,1 % | 18 mars 2025 | Auto-déclaré |
| 99 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,6 % | 22 septembre 2025 | Auto-déclaré |
| 100 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 46,4 % | 14 avril 2025 | Auto-déclaré |
| 101 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,9 % | 22 septembre 2025 | Auto-déclaré |
| 102 | GPT-5.1 Codex Mini | OpenAI | 🔒 Propriétaire | 42,1 % | 12 novembre 2025 | Auto-déclaré |
| 103 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 40,2 % | 14 avril 2025 | Auto-déclaré |
| 104 | Gemini Diffusion | 🔒 Propriétaire | 23,3 % | 20 mai 2025 | Auto-déclaré | |
| 105 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 11,6 % | 26 juin 2025 | Auto-déclaré | |
| 106 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 11,6 % | 20 mai 2025 | Auto-déclaré | |
| 107 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 6,7 % | 26 juin 2025 | Auto-déclaré | |
| 108 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 6,7 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 108 modèles évalués, dont 64 de grands éditeurs. Score médian de l'ensemble : 85,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AIME 2025 indique qu’un modèle résout correctement une forte proportion de problèmes exigeant des déductions multi-étapes et une manipulation symbolique structurée. La métrique exact match impose de fournir précisément la réponse entière attendue, sans crédit partiel. La lecture des résultats doit toutefois tenir compte de leur fiabilité, puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.
Le classement montre un niveau global élevé parmi les 108 modèles recensés, avec une médiane de 86 % et GPT-5.2 en tête à 100 %. Ce plafond atteint signale une saturation possible pour les meilleurs systèmes et réduit la capacité du benchmark à les départager. L’accès public aux problèmes crée aussi un risque de contamination des évaluations, sans établir qu’elle a effectivement eu lieu. Enfin, sa portée reste ciblée sur 30 problèmes en anglais, issus d’une compétition mathématique de niveau olympiade. Les résultats renseignent donc précisément le raisonnement mathématique évalué, mais pas les capacités générales d’un modèle.
Sources des scores : llm-stats.