OTIS Mock AIME 2024-2025
Epoch: OTIS Mock AIME 2024-2025 est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques de niveau compétition, dans un registre intermédiaire à avancé. Il rassemble des exercices inspirés du format AIME, avec des réponses entières comprises entre 0 et 999.
Epoch: OTIS Mock AIME 2024-2025 est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques de niveau compétition, dans un registre intermédiaire à avancé. Il rassemble des exercices inspirés du format AIME, avec des réponses entières comprises entre 0 et 999.
Plus exigeant que MATH niveau 5, mais moins difficile que FrontierMath, il sert à différencier les capacités de raisonnement mathématique des modèles sur des problèmes structurés. La performance est déterminée par l’exactitude des réponses produites.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Resolution de problemes mathematiques de niveau competition (style AIME), intermediaire a avance |
| Modalité | Texte |
| Type de questions | Problemes mathematiques a reponse entiere (entiers de 0 a 999) |
| Métrique d'évaluation | Exactitude (accuracy) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 45 problemes (15 Mock AIME 2024, 15 Mock AIME 2025 I, 15 Mock AIME 2025 II) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (64)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 100,0 % | 9 juillet 2026 | ✅ Mesuré |
| 2 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 99,7 % | 9 juillet 2026 | ✅ Mesuré |
| 3 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 98,3 % | 9 juillet 2026 | ✅ Mesuré |
| 4 | Grok 4.5 | xAI | 🔒 Propriétaire | 97,8 % | 16 juillet 2026 | ✅ Mesuré |
| 5 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 96,7 % | 24 avril 2026 | ✅ Mesuré |
| 6 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 96,1 % | 11 décembre 2025 | ✅ Mesuré |
| 7 | Gemini 3.1 Pro Preview | ▫ n.d. | 95,6 % | 19 février 2026 | ✅ Mesuré | |
| 8 | Grok 4.3 Beta | xAI | ▫ n.d. | 93,3 % | 17 avril 2026 | ✅ Mesuré |
| 9 | Grok 4.20 | xAI | ▫ n.d. | 92,2 % | 31 mars 2026 | ✅ Mesuré |
| 10 | GPT-5 | OpenAI | 🔒 Propriétaire | 91,4 % | 7 août 2025 | ✅ Mesuré |
| 11 | Qwen 3.6 Max | Qwen | ▫ n.d. | 91,1 % | 20 avril 2026 | ✅ Mesuré |
| 12 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 88,6 % | 13 novembre 2025 | ✅ Mesuré |
| 13 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 86,7 % | 7 août 2025 | ✅ Mesuré |
| 14 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 86,1 % | 24 novembre 2025 | ✅ Mesuré |
| 15 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 86,1 % | 27 avril 2026 | ✅ Mesuré |
| 16 | Qwen: Qwen3.5-Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 85,6 % | 25 février 2026 | ✅ Mesuré |
| 17 | Qwen 3.5 Plus | Qwen | ▫ n.d. | 85,0 % | 16 février 2026 | ✅ Mesuré |
| 18 | o3 | OpenAI | 🔒 Propriétaire | 83,9 % | 16 avril 2025 | ✅ Mesuré |
| 19 | Kimi K2 Thinking Turbo | Moonshot AI | ▫ n.d. | 83,1 % | 6 novembre 2025 | ✅ Mesuré |
| 20 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 81,1 % | 7 août 2025 | ✅ Mesuré |
| 21 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 77,8 % | 29 septembre 2025 | ✅ Mesuré |
| 22 | Qwen3-Max-Instruct | Qwen | ▫ n.d. | 73,3 % | 24 septembre 2025 | ✅ Mesuré |
| 23 | o1 | OpenAI | 🔒 Propriétaire | 73,3 % | 17 décembre 2024 | ✅ Mesuré |
| 24 | Gemini 2.5 Flash Preview | ▫ n.d. | 73,1 % | 25 septembre 2025 | ✅ Mesuré | |
| 25 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 71,1 % | 22 mai 2025 | ✅ Mesuré |
| 26 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 68,9 % | 5 août 2025 | ✅ Mesuré |
| 27 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 66,7 % | 15 octobre 2025 | ✅ Mesuré |
| 28 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 64,4 % | 22 mai 2025 | ✅ Mesuré |
| 29 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 57,8 % | 24 février 2025 | ✅ Mesuré |
| 30 | Gemini 2.0 Flash Experimental | ▫ n.d. | 57,8 % | 21 janvier 2025 | ✅ Mesuré | |
| 31 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 44,7 % | 14 avril 2025 | ✅ Mesuré |
| 32 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 38,3 % | 14 avril 2025 | ✅ Mesuré |
| 33 | OpenAI: GPT-4.5 (Preview) | OpenAI | 🔒 Propriétaire | 37,8 % | 27 février 2025 | ✅ Mesuré |
| 34 | Mistral: Mistral Medium 3 | Mistral AI | ▫ n.d. | 32,2 % | 7 mai 2025 | ✅ Mesuré |
| 35 | Magistral Small 1.1 | Mistral AI | ▫ n.d. | 30,0 % | 10 juin 2025 | ✅ Mesuré |
| 36 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 28,9 % | 14 avril 2025 | ✅ Mesuré |
| 37 | qwen-plus-2025-01-25 | Alibaba Cloud / Qwen Team | ▫ n.d. | 17,8 % | 8 septembre 2025 | ✅ Mesuré |
| 38 | qwen2.5-max | Qwen | ▫ n.d. | 16,1 % | 25 janvier 2025 | ✅ Mesuré |
| 39 | Llama 3.1-405B | Meta | ▫ n.d. | 9,7 % | 23 juillet 2024 | ✅ Mesuré |
| 40 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 8,5 % | 22 octobre 2024 | ✅ Mesuré |
| 41 | Qwen2.5-72B | Qwen | ▫ n.d. | 8,1 % | 19 septembre 2024 | ✅ Mesuré |
| 42 | Qwen2.5-32B | Qwen | ▫ n.d. | 7,4 % | 17 septembre 2024 | ✅ Mesuré |
| 43 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 6,9 % | 18 juillet 2024 | ✅ Mesuré |
| 44 | GPT-4o | OpenAI | 🔒 Propriétaire | 6,4 % | 27 mars 2025 | ✅ Mesuré |
| 45 | Qwen: Qwen-Turbo | Alibaba Cloud / Qwen Team | ▫ n.d. | 6,1 % | 1 février 2025 | ✅ Mesuré |
| 46 | Mistral Small 3.1 | Mistral AI | ▫ n.d. | 5,8 % | 17 mars 2025 | ✅ Mesuré |
| 47 | Mistral Small 3 | Mistral AI | ▫ n.d. | 5,3 % | 25 janvier 2025 | ✅ Mesuré |
| 48 | Llama 3.3 70B | Meta | ▫ n.d. | 5,1 % | 6 décembre 2024 | ✅ Mesuré |
| 49 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 4,7 % | 29 février 2024 | ✅ Mesuré |
| 50 | Tulu 3 (Tülu 3) 70B | Allen Institute for AI | ▫ n.d. | 4,4 % | 21 novembre 2024 | ✅ Mesuré |
| 51 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 4,3 % | 4 novembre 2024 | ✅ Mesuré |
| 52 | Llama 3-70B | Meta | ▫ n.d. | 4,3 % | 18 avril 2024 | ✅ Mesuré |
| 53 | Llama 3.1-70B | Meta | ▫ n.d. | 3,6 % | 23 juillet 2024 | ✅ Mesuré |
| 54 | Llama 3.2 90B | Meta | ▫ n.d. | 2,6 % | 24 septembre 2024 | ✅ Mesuré |
| 55 | Claude 2 | Anthropic | 🔒 Propriétaire | 2,5 % | 11 juillet 2023 | ✅ Mesuré |
| 56 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 2,5 % | 29 février 2024 | ✅ Mesuré |
| 57 | Hermes 2 Theta Llama-3 70B | Nous Research | ▫ n.d. | 2,5 % | 20 juin 2024 | ✅ Mesuré |
| 58 | Llama 3.1-8B | Meta | ▫ n.d. | 2,5 % | 23 juillet 2024 | ✅ Mesuré |
| 59 | Claude 2.1 | Anthropic | 🔒 Propriétaire | 1,9 % | 21 novembre 2023 | ✅ Mesuré |
| 60 | Mistral Large | Mistral AI | ▫ n.d. | 1,9 % | 26 février 2024 | ✅ Mesuré |
| 61 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 1,8 % | 13 mars 2024 | ✅ Mesuré |
| 62 | GPT-4 | OpenAI | 🔒 Propriétaire | 1,1 % | 28 août 2023 | ✅ Mesuré |
| 63 | Llama 3-8B | Meta | ▫ n.d. | 0,8 % | 18 avril 2024 | ✅ Mesuré |
| 64 | Llama 2-70B | Meta | ▫ n.d. | 0,0 % | 18 juillet 2023 | ✅ Mesuré |
Classement établi sur 64 modèles évalués, dont 57 de grands éditeurs. Score médian de l'ensemble : 38,1 %.
Notre analyse
Un score élevé indique qu’un modèle résout correctement une large part de ces problèmes de compétition et fournit précisément l’entier attendu. La fiabilité du classement est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que de reposer exclusivement sur des résultats auto-déclarés. Avec 116 modèles évalués et un score médian de 68 %, le benchmark fait apparaître des écarts substantiels de maîtrise. GPT-5.5 atteint toutefois 100 %, ce qui signale une saturation au sommet pour ce modèle et réduit la capacité du jeu à départager les systèmes les plus performants. Le caractère public du benchmark peut aussi accroître le risque de contamination lors de l’entraînement ou de l’évaluation. Sa portée reste circonscrite à 45 problèmes en anglais, au format AIME et à réponse entière. Le classement renseigne donc spécifiquement sur la résolution de ce type de problèmes mathématiques, sans constituer une mesure générale de l’ensemble des capacités d’un modèle.
Sources des scores : epoch.