OTIS Mock AIME 2024-2025

Epoch: OTIS Mock AIME 2024-2025 est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques de niveau compétition, dans un registre intermédiaire à avancé. Il rassemble des exercices inspirés du format AIME, avec des réponses entières comprises entre 0 et 999.

Epoch: OTIS Mock AIME 2024-2025 est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques de niveau compétition, dans un registre intermédiaire à avancé. Il rassemble des exercices inspirés du format AIME, avec des réponses entières comprises entre 0 et 999.

Plus exigeant que MATH niveau 5, mais moins difficile que FrontierMath, il sert à différencier les capacités de raisonnement mathématique des modèles sur des problèmes structurés. La performance est déterminée par l’exactitude des réponses produites.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesResolution de problemes mathematiques de niveau competition (style AIME), intermediaire a avance
ModalitéTexte
Type de questionsProblemes mathematiques a reponse entiere (entiers de 0 a 999)
Métrique d'évaluationExactitude (accuracy)
AccèsPublic
Languesanglais
Taille du jeu45 problemes (15 Mock AIME 2024, 15 Mock AIME 2025 I, 15 Mock AIME 2025 II)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (64)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
2GPT-5.6 TerraOpenAI🔒 Propriétaire99,7 %9 juillet 2026✅ Mesuré
3GPT-5.6 LunaOpenAI🔒 Propriétaire98,3 %9 juillet 2026✅ Mesuré
4Grok 4.5xAI🔒 Propriétaire97,8 %16 juillet 2026✅ Mesuré
5DeepSeek V4 ProDeepSeek▫ n.d.96,7 %24 avril 2026✅ Mesuré
6GPT-5.2OpenAI🔒 Propriétaire96,1 %11 décembre 2025✅ Mesuré
7Gemini 3.1 Pro PreviewGoogle▫ n.d.95,6 %19 février 2026✅ Mesuré
8Grok 4.3 BetaxAI▫ n.d.93,3 %17 avril 2026✅ Mesuré
9Grok 4.20xAI▫ n.d.92,2 %31 mars 2026✅ Mesuré
10GPT-5OpenAI🔒 Propriétaire91,4 %7 août 2025✅ Mesuré
11Qwen 3.6 MaxQwen▫ n.d.91,1 %20 avril 2026✅ Mesuré
12GPT-5.1OpenAI🔒 Propriétaire88,6 %13 novembre 2025✅ Mesuré
13GPT-5 miniOpenAI🔒 Propriétaire86,7 %7 août 2025✅ Mesuré
14Claude Opus 4.5Anthropic🔒 Propriétaire86,1 %24 novembre 2025✅ Mesuré
15Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.86,1 %27 avril 2026✅ Mesuré
16Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.85,6 %25 février 2026✅ Mesuré
17Qwen 3.5 PlusQwen▫ n.d.85,0 %16 février 2026✅ Mesuré
18o3OpenAI🔒 Propriétaire83,9 %16 avril 2025✅ Mesuré
19Kimi K2 Thinking TurboMoonshot AI▫ n.d.83,1 %6 novembre 2025✅ Mesuré
20GPT-5 nanoOpenAI🔒 Propriétaire81,1 %7 août 2025✅ Mesuré
21Claude Sonnet 4.5Anthropic🔒 Propriétaire77,8 %29 septembre 2025✅ Mesuré
22Qwen3-Max-InstructQwen▫ n.d.73,3 %24 septembre 2025✅ Mesuré
23o1OpenAI🔒 Propriétaire73,3 %17 décembre 2024✅ Mesuré
24Gemini 2.5 Flash PreviewGoogle▫ n.d.73,1 %25 septembre 2025✅ Mesuré
25Claude Sonnet 4Anthropic🔒 Propriétaire71,1 %22 mai 2025✅ Mesuré
26Claude Opus 4.1Anthropic🔒 Propriétaire68,9 %5 août 2025✅ Mesuré
27Claude Haiku 4.5Anthropic🔒 Propriétaire66,7 %15 octobre 2025✅ Mesuré
28Claude Opus 4Anthropic🔒 Propriétaire64,4 %22 mai 2025✅ Mesuré
29Claude 3.7 SonnetAnthropic🔒 Propriétaire57,8 %24 février 2025✅ Mesuré
30Gemini 2.0 Flash ExperimentalGoogle▫ n.d.57,8 %21 janvier 2025✅ Mesuré
31GPT-4.1 miniOpenAI🔒 Propriétaire44,7 %14 avril 2025✅ Mesuré
32GPT-4.1OpenAI🔒 Propriétaire38,3 %14 avril 2025✅ Mesuré
33OpenAI: GPT-4.5 (Preview)OpenAI🔒 Propriétaire37,8 %27 février 2025✅ Mesuré
34Mistral: Mistral Medium 3Mistral AI▫ n.d.32,2 %7 mai 2025✅ Mesuré
35Magistral Small 1.1Mistral AI▫ n.d.30,0 %10 juin 2025✅ Mesuré
36GPT-4.1 nanoOpenAI🔒 Propriétaire28,9 %14 avril 2025✅ Mesuré
37qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.17,8 %8 septembre 2025✅ Mesuré
38qwen2.5-maxQwen▫ n.d.16,1 %25 janvier 2025✅ Mesuré
39Llama 3.1-405BMeta▫ n.d.9,7 %23 juillet 2024✅ Mesuré
40Claude 3.5 SonnetAnthropic🔒 Propriétaire8,5 %22 octobre 2024✅ Mesuré
41Qwen2.5-72BQwen▫ n.d.8,1 %19 septembre 2024✅ Mesuré
42Qwen2.5-32BQwen▫ n.d.7,4 %17 septembre 2024✅ Mesuré
43GPT-4o miniOpenAI🔒 Propriétaire6,9 %18 juillet 2024✅ Mesuré
44GPT-4oOpenAI🔒 Propriétaire6,4 %27 mars 2025✅ Mesuré
45Qwen: Qwen-TurboAlibaba Cloud / Qwen Team▫ n.d.6,1 %1 février 2025✅ Mesuré
46Mistral Small 3.1Mistral AI▫ n.d.5,8 %17 mars 2025✅ Mesuré
47Mistral Small 3Mistral AI▫ n.d.5,3 %25 janvier 2025✅ Mesuré
48Llama 3.3 70BMeta▫ n.d.5,1 %6 décembre 2024✅ Mesuré
49Claude 3 OpusAnthropic🔒 Propriétaire4,7 %29 février 2024✅ Mesuré
50Tulu 3 (Tülu 3) 70BAllen Institute for AI▫ n.d.4,4 %21 novembre 2024✅ Mesuré
51Claude 3.5 HaikuAnthropic🔒 Propriétaire4,3 %4 novembre 2024✅ Mesuré
52Llama 3-70BMeta▫ n.d.4,3 %18 avril 2024✅ Mesuré
53Llama 3.1-70BMeta▫ n.d.3,6 %23 juillet 2024✅ Mesuré
54Llama 3.2 90BMeta▫ n.d.2,6 %24 septembre 2024✅ Mesuré
55Claude 2Anthropic🔒 Propriétaire2,5 %11 juillet 2023✅ Mesuré
56Claude 3 SonnetAnthropic🔒 Propriétaire2,5 %29 février 2024✅ Mesuré
57Hermes 2 Theta Llama-3 70BNous Research▫ n.d.2,5 %20 juin 2024✅ Mesuré
58Llama 3.1-8BMeta▫ n.d.2,5 %23 juillet 2024✅ Mesuré
59Claude 2.1Anthropic🔒 Propriétaire1,9 %21 novembre 2023✅ Mesuré
60Mistral LargeMistral AI▫ n.d.1,9 %26 février 2024✅ Mesuré
61Claude 3 HaikuAnthropic🔒 Propriétaire1,8 %13 mars 2024✅ Mesuré
62GPT-4OpenAI🔒 Propriétaire1,1 %28 août 2023✅ Mesuré
63Llama 3-8BMeta▫ n.d.0,8 %18 avril 2024✅ Mesuré
64Llama 2-70BMeta▫ n.d.0,0 %18 juillet 2023✅ Mesuré

Classement établi sur 64 modèles évalués, dont 57 de grands éditeurs. Score médian de l'ensemble : 38,1 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une large part de ces problèmes de compétition et fournit précisément l’entier attendu. La fiabilité du classement est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que de reposer exclusivement sur des résultats auto-déclarés. Avec 116 modèles évalués et un score médian de 68 %, le benchmark fait apparaître des écarts substantiels de maîtrise. GPT-5.5 atteint toutefois 100 %, ce qui signale une saturation au sommet pour ce modèle et réduit la capacité du jeu à départager les systèmes les plus performants. Le caractère public du benchmark peut aussi accroître le risque de contamination lors de l’entraînement ou de l’évaluation. Sa portée reste circonscrite à 45 problèmes en anglais, au format AIME et à réponse entière. Le classement renseigne donc spécifiquement sur la résolution de ce type de problèmes mathématiques, sans constituer une mesure générale de l’ensemble des capacités d’un modèle.


Sources des scores : epoch.