FrontierMath-Tier-4-2025-07-01-Public

Epoch: FrontierMath-Tier-4-2025-07-01-Public est un sous-ensemble public du niveau le plus difficile de FrontierMath, créé par Epoch AI. Il rassemble des problèmes mathématiques de niveau recherche extrême, conçus comme des projets de recherche à court terme par des professeurs et des…

Epoch: FrontierMath-Tier-4-2025-07-01-Public est un sous-ensemble public du niveau le plus difficile de FrontierMath, créé par Epoch AI. Il rassemble des problèmes mathématiques de niveau recherche extrême, conçus comme des projets de recherche à court terme par des professeurs et des post-doctorants.

Le benchmark évalue la capacité des modèles à résoudre des problèmes ouverts produisant une réponse numérique ou symbolique, soumise sous forme d’objet Python. Il sert à distinguer les systèmes capables de mener un raisonnement mathématique avancé sur des tâches dont certaines pourraient résister à l’IA pendant des décennies.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesRaisonnement mathématique de niveau recherche extrême : problèmes les plus difficiles de FrontierMath, certains pouvant rester non résolus par l'IA pendant des décennies.
ModalitéTexte
Type de questionsProblèmes ouverts à réponse numérique/symbolique (soumis comme objets Python)
Métrique d'évaluationExactitude binaire (% de problèmes résolus)
AccèsPublic
LanguesAnglais
Taille du jeuTier 4 : ~50 problèmes (sous-ensemble public restreint, ex. 2 problèmes rendus publics)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (15)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude 3.5 SonnetAnthropic🔒 Propriétaire0,0 %22 octobre 2024✅ Mesuré
2Claude 3.7 SonnetAnthropic🔒 Propriétaire0,0 %24 février 2025✅ Mesuré
3Claude Opus 4Anthropic🔒 Propriétaire0,0 %22 mai 2025✅ Mesuré
4Claude Sonnet 4Anthropic🔒 Propriétaire0,0 %22 mai 2025✅ Mesuré
5Claude Sonnet 4.5Anthropic🔒 Propriétaire0,0 %29 septembre 2025✅ Mesuré
6GPT-4.1OpenAI🔒 Propriétaire0,0 %14 avril 2025✅ Mesuré
7GPT-5OpenAI🔒 Propriétaire0,0 %7 août 2025✅ Mesuré
8GPT-5 miniOpenAI🔒 Propriétaire0,0 %7 août 2025✅ Mesuré
9GPT-5 nanoOpenAI🔒 Propriétaire0,0 %7 août 2025✅ Mesuré
10GPT-5.2OpenAI🔒 Propriétaire0,0 %11 décembre 2025✅ Mesuré
11Gemini 2.5 Pro PreviewGoogle▫ n.d.0,0 %5 juin 2025✅ Mesuré
12Gemini 3.1 Pro PreviewGoogle▫ n.d.0,0 %19 février 2026✅ Mesuré
13Kimi K2Moonshot AI▫ n.d.0,0 %6 novembre 2025✅ Mesuré
14Qwen 3.6 MaxQwen▫ n.d.0,0 %20 avril 2026✅ Mesuré
15o3OpenAI🔒 Propriétaire0,0 %16 avril 2025✅ Mesuré

Classement établi sur 15 modèles évalués, dont 14 de grands éditeurs. Score médian de l'ensemble : 0,0 %.

Notre analyse

Un score élevé indique qu’un modèle fournit exactement la réponse attendue sur une forte proportion de ces problèmes de recherche. L’exactitude étant binaire, une solution n’est comptabilisée que comme résolue ou non résolue. Les scores sont au moins partiellement mesurés par un tiers, ce qui apporte un contrôle externe au-delà d’une évaluation entièrement auto-déclarée.

Le classement révèle une distribution très polarisée : Claude Fable 5 atteint 100 %, tandis que le score médian des 36 modèles évalués reste à 0 %. Le plafond est donc atteint par le meilleur modèle, mais cette réussite ne traduit pas une saturation générale du benchmark. La portée des conclusions demeure liée à un Tier 4 d’environ 50 problèmes et à un sous-ensemble public restreint, dont seuls quelques exemples ont été rendus publics. Ce caractère public doit aussi être pris en compte dans l’interprétation d’un éventuel risque de contamination. Enfin, le résultat mesure spécifiquement la résolution exacte de problèmes mathématiques extrêmes en anglais, plutôt qu’une capacité générale sur l’ensemble des usages de l’IA.


Sources des scores : epoch.