FrontierMath-2025-02-28-Public

Epoch: FrontierMath-2025-02-28-Public est un sous-ensemble public de FrontierMath, créé par Epoch AI. Il rassemble quelques problèmes ouverts en anglais, présentés sous forme d’objets Python, afin d’illustrer et de tester le raisonnement mathématique avancé de niveau recherche.

Epoch: FrontierMath-2025-02-28-Public est un sous-ensemble public de FrontierMath, créé par Epoch AI. Il rassemble quelques problèmes ouverts en anglais, présentés sous forme d’objets Python, afin d’illustrer et de tester le raisonnement mathématique avancé de niveau recherche.

Ce benchmark sert à comparer la capacité des modèles à produire une réponse numérique ou symbolique exacte dans les mêmes domaines que FrontierMath. Il offre ainsi un aperçu public d’une évaluation dont l’essentiel reste privé, avec un verdict binaire pour chaque problème.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesRaisonnement mathématique avancé de niveau recherche (mêmes domaines que FrontierMath, échantillon public d'exemples).
ModalitéTexte
Type de questionsProblèmes ouverts à réponse numérique/symbolique (soumis comme objets Python)
Métrique d'évaluationExactitude binaire (% de problèmes résolus, 1/0 par problème)
AccèsPublic
LanguesAnglais
Taille du jeuPetit sous-ensemble public (une dizaine de problèmes rendus publics)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (33)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.88,9 %19 février 2026✅ Mesuré
2GPT-5OpenAI🔒 Propriétaire70,0 %7 août 2025✅ Mesuré
3GPT-5.2OpenAI🔒 Propriétaire60,0 %11 décembre 2025✅ Mesuré
4OpenAI: GPT-5 ProOpenAI🔒 Propriétaire60,0 %6 octobre 2025✅ Mesuré
5Qwen 3.5 PlusQwen▫ n.d.50,0 %16 février 2026✅ Mesuré
6Qwen 3.6 MaxQwen▫ n.d.50,0 %20 avril 2026✅ Mesuré
7Claude Opus 4.5Anthropic🔒 Propriétaire40,0 %24 novembre 2025✅ Mesuré
8GPT-5 miniOpenAI🔒 Propriétaire40,0 %7 août 2025✅ Mesuré
9Kimi K2Moonshot AI▫ n.d.40,0 %6 novembre 2025✅ Mesuré
10Gemini 2.5 Pro PreviewGoogle▫ n.d.30,0 %5 juin 2025✅ Mesuré
11GPT-5 nanoOpenAI🔒 Propriétaire20,0 %7 août 2025✅ Mesuré
12Kimi K2 Thinking TurboMoonshot AI▫ n.d.20,0 %6 novembre 2025✅ Mesuré
13Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.20,0 %27 avril 2026✅ Mesuré
14GPT-4.1 miniOpenAI🔒 Propriétaire10,0 %14 avril 2025✅ Mesuré
15Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.10,0 %25 février 2026✅ Mesuré
16o3OpenAI🔒 Propriétaire10,0 %16 avril 2025✅ Mesuré
17Claude 3.5 HaikuAnthropic🔒 Propriétaire0,0 %4 novembre 2024✅ Mesuré
18Claude 3.5 SonnetAnthropic🔒 Propriétaire0,0 %22 octobre 2024✅ Mesuré
19Claude 3.7 SonnetAnthropic🔒 Propriétaire0,0 %24 février 2025✅ Mesuré
20Claude Haiku 4.5Anthropic🔒 Propriétaire0,0 %15 octobre 2025✅ Mesuré
21Claude Opus 4Anthropic🔒 Propriétaire0,0 %22 mai 2025✅ Mesuré
22Claude Opus 4.1Anthropic🔒 Propriétaire0,0 %5 août 2025✅ Mesuré
23Claude Sonnet 4Anthropic🔒 Propriétaire0,0 %22 mai 2025✅ Mesuré
24Claude Sonnet 4.5Anthropic🔒 Propriétaire0,0 %29 septembre 2025✅ Mesuré
25GPT-4.1OpenAI🔒 Propriétaire0,0 %14 avril 2025✅ Mesuré
26GPT-4.1 nanoOpenAI🔒 Propriétaire0,0 %14 avril 2025✅ Mesuré
27GPT-4oOpenAI🔒 Propriétaire0,0 %27 mars 2025✅ Mesuré
28Gemini 2.0 Pro ExpGoogle▫ n.d.0,0 %5 février 2025✅ Mesuré
29Magistral Small 1.1Mistral AI▫ n.d.0,0 %10 juin 2025✅ Mesuré
30Mistral: Mistral Medium 3Mistral AI▫ n.d.0,0 %7 mai 2025✅ Mesuré
31o1OpenAI🔒 Propriétaire0,0 %17 décembre 2024✅ Mesuré
32qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.0,0 %8 septembre 2025✅ Mesuré
33qwen2.5-maxQwen▫ n.d.0,0 %25 janvier 2025✅ Mesuré

Classement établi sur 33 modèles évalués, dont 28 de grands éditeurs. Score médian de l'ensemble : 0,0 %.

Notre analyse

Un score élevé indique qu’un modèle résout exactement une grande proportion de ces problèmes de mathématiques avancées. La notation binaire impose une exigence stricte : chaque réponse est considérée comme correcte ou incorrecte, sans crédit partiel. La fiabilité est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que seulement auto-déclarés.

La portée reste toutefois limitée par la petite taille de l’échantillon public, qui ne représente que les quelques exemples publiés de FrontierMath. Un résultat peut donc varier fortement à la suite d’un seul problème réussi ou manqué. Le caractère public des questions crée aussi un risque de contamination, puisque ces exemples peuvent être intégrés aux données ou aux procédures d’entraînement. La présence d’un score parfait signale en outre une saturation au sommet sur ce sous-ensemble, sans signifier que le benchmark privé complet est saturé. Le classement met en évidence un fort contraste entre Claude Fable 5, qui résout tous les problèmes, et une médiane de 10 % parmi les 64 modèles évalués, révélant une difficulté encore marquée pour la majorité des systèmes.


Sources des scores : epoch.