FrontierMath-2025-02-28-Private

Epoch: FrontierMath-2025-02-28-Private est un snapshot du jeu privé FrontierMath créé par Epoch AI. Il rassemble des problèmes mathématiques originaux et extrêmement difficiles, conçus et vérifiés par des mathématiciens experts, dans des domaines comme la théorie des nombres, l’analyse…

Epoch: FrontierMath-2025-02-28-Private est un snapshot du jeu privé FrontierMath créé par Epoch AI. Il rassemble des problèmes mathématiques originaux et extrêmement difficiles, conçus et vérifiés par des mathématiciens experts, dans des domaines comme la théorie des nombres, l’analyse réelle, la géométrie algébrique et la théorie des catégories.

Le benchmark mesure la capacité des modèles à résoudre des problèmes de niveau recherche produisant une réponse numérique ou symbolique, soumise sous forme d’objet Python. Son exactitude binaire en fait un test direct du raisonnement mathématique avancé.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesRaisonnement mathématique avancé de niveau recherche (théorie des nombres, analyse réelle, géométrie algébrique, théorie des catégories).
ModalitéTexte
Type de questionsProblèmes ouverts à réponse numérique/symbolique (soumis comme objets Python)
Métrique d'évaluationExactitude binaire (% de problèmes résolus, 1/0 par problème)
AccèsJeu de test privé (réponses non divulguées)
Licencepropriétaire
LanguesAnglais
Taille du jeu≈300 problèmes (jeu privé ; FrontierMath comptait ~350 problèmes Tiers 1-4 à l'origine)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (32)

#ModèleÉditeurLicenceScoreSortieFiabilité
1OpenAI: GPT-5.4 ProOpenAI🔒 Propriétaire50,0 %5 mars 2026✅ Mesuré
2GPT-5.2OpenAI🔒 Propriétaire40,7 %11 décembre 2025✅ Mesuré
3Gemini 3.1 Pro PreviewGoogle▫ n.d.36,9 %19 février 2026✅ Mesuré
4GPT-5OpenAI🔒 Propriétaire32,4 %7 août 2025✅ Mesuré
5GPT-5.1OpenAI🔒 Propriétaire31,0 %13 novembre 2025✅ Mesuré
6Gemini 2.5 Deep ThinkGoogle▫ n.d.29,0 %1 août 2025✅ Mesuré
7GPT-5 miniOpenAI🔒 Propriétaire27,2 %7 août 2025✅ Mesuré
8Qwen 3.6 MaxQwen▫ n.d.23,1 %20 avril 2026✅ Mesuré
9Kimi K2Moonshot AI▫ n.d.21,4 %6 novembre 2025✅ Mesuré
10Qwen 3.5 PlusQwen▫ n.d.21,0 %16 février 2026✅ Mesuré
11Claude Opus 4.5Anthropic🔒 Propriétaire20,7 %24 novembre 2025✅ Mesuré
12o3OpenAI🔒 Propriétaire18,7 %16 avril 2025✅ Mesuré
13Claude Sonnet 4.5Anthropic🔒 Propriétaire15,2 %29 septembre 2025✅ Mesuré
14Gemini 2.5 Pro PreviewGoogle▫ n.d.10,3 %5 juin 2025✅ Mesuré
15Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.10,3 %27 avril 2026✅ Mesuré
16o1OpenAI🔒 Propriétaire9,3 %17 décembre 2024✅ Mesuré
17GPT-5 nanoOpenAI🔒 Propriétaire8,3 %7 août 2025✅ Mesuré
18Claude Opus 4.1Anthropic🔒 Propriétaire7,2 %5 août 2025✅ Mesuré
19Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.6,2 %25 février 2026✅ Mesuré
20Claude Haiku 4.5Anthropic🔒 Propriétaire5,9 %15 octobre 2025✅ Mesuré
21GPT-4.1OpenAI🔒 Propriétaire5,5 %14 avril 2025✅ Mesuré
22Claude Opus 4Anthropic🔒 Propriétaire4,5 %22 mai 2025✅ Mesuré
23GPT-4.1 miniOpenAI🔒 Propriétaire4,5 %14 avril 2025✅ Mesuré
24Claude 3.7 SonnetAnthropic🔒 Propriétaire4,1 %24 février 2025✅ Mesuré
25Claude Sonnet 4Anthropic🔒 Propriétaire4,1 %22 mai 2025✅ Mesuré
26Claude 3.5 SonnetAnthropic🔒 Propriétaire2,1 %22 octobre 2024✅ Mesuré
27qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.1,7 %8 septembre 2025✅ Mesuré
28GPT-4.1 nanoOpenAI🔒 Propriétaire1,0 %14 avril 2025✅ Mesuré
29qwen2.5-maxQwen▫ n.d.1,0 %25 janvier 2025✅ Mesuré
30Mistral: Mistral Medium 3Mistral AI▫ n.d.0,3 %7 mai 2025✅ Mesuré
31Claude 3.5 HaikuAnthropic🔒 Propriétaire0,3 %4 novembre 2024✅ Mesuré
32GPT-4oOpenAI🔒 Propriétaire0,3 %27 mars 2025✅ Mesuré

Classement établi sur 32 modèles évalués, dont 28 de grands éditeurs. Score médian de l'ensemble : 8,8 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une part importante de problèmes de niveau recherche, selon un verdict strict de réussite ou d’échec pour chaque exercice. Cette métrique réduit l’ambiguïté du résultat, tandis que la conception et la vérification par des mathématiciens experts renforcent la rigueur du jeu. Les scores sont au moins partiellement mesurés par un tiers, ce qui leur confère une assise plus indépendante que des résultats uniquement auto-déclarés.

Le caractère privé du test, la non-divulgation des réponses et la vérification automatisée visent à limiter la contamination. Celle-ci ne peut toutefois être présentée comme totalement éliminée. Le classement de 69 modèles montre une forte difficulté persistante : avec une médiane à 14 % et GPT-5.5 Pro en tête à 52 %, le benchmark reste loin d’une saturation générale. L’écart entre le meilleur résultat et le niveau médian révèle une différenciation nette des capacités. Sa portée demeure spécialisée : il évalue le raisonnement mathématique avancé dans les domaines couverts, plutôt que les performances générales des modèles.


Sources des scores : epoch.