FrontierMath-Tiers-1-3-v2-Private

Epoch: FrontierMath-Tiers-1-3-v2-Private est un benchmark créé par Epoch AI pour évaluer le raisonnement mathématique avancé, depuis le niveau du premier cycle universitaire jusqu’à des problèmes exploratoires de niveau doctoral.

Epoch: FrontierMath-Tiers-1-3-v2-Private est un benchmark créé par Epoch AI pour évaluer le raisonnement mathématique avancé, depuis le niveau du premier cycle universitaire jusqu’à des problèmes exploratoires de niveau doctoral.

Il repose sur des problèmes de recherche en anglais exigeant une réponse exacte, numérique ou symbolique. Son évaluation binaire distingue strictement les réponses correctes des réponses incorrectes. Cet ensemble privé et tenu à l’écart sert ainsi à comparer la capacité des modèles à résoudre rigoureusement des questions mathématiques complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesRaisonnement mathematique avance, du niveau premier cycle aux problemes exploratoires de niveau doctorat
ModalitéTexte
Type de questionsproblemes mathematiques de recherche a reponse exacte (numerique/symbolique)
Métrique d'évaluationexactitude binaire (1 si correct, 0 sinon)
AccèsJeu de test privé (réponses non divulguées)
Licencepropriétaire
Languesanglais
Taille du jeu295 problemes (ensemble prive Tiers 1-3 v2)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (17)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire89,1 %9 juillet 2026✅ Mesuré
2GPT-5.6 TerraOpenAI🔒 Propriétaire86,0 %9 juillet 2026✅ Mesuré
3OpenAI: GPT-5.4 ProOpenAI🔒 Propriétaire82,5 %5 mars 2026✅ Mesuré
4GPT-5.6 LunaOpenAI🔒 Propriétaire82,1 %9 juillet 2026✅ Mesuré
5GPT-5.2OpenAI🔒 Propriétaire67,4 %11 décembre 2025✅ Mesuré
6Gemini 3.1 Pro PreviewGoogle▫ n.d.59,6 %19 février 2026✅ Mesuré
7Grok 4.5xAI🔒 Propriétaire57,2 %16 juillet 2026✅ Mesuré
8OpenAI: GPT-5 ProOpenAI🔒 Propriétaire55,8 %6 octobre 2025✅ Mesuré
9GPT-5OpenAI🔒 Propriétaire55,4 %7 août 2025✅ Mesuré
10GPT-5 miniOpenAI🔒 Propriétaire46,7 %7 août 2025✅ Mesuré
11DeepSeek V4 ProDeepSeek▫ n.d.45,3 %24 avril 2026✅ Mesuré
12Grok 4.20xAI▫ n.d.44,9 %31 mars 2026✅ Mesuré
13Grok 4.3 BetaxAI▫ n.d.42,8 %17 avril 2026✅ Mesuré
14Claude Opus 4.5Anthropic🔒 Propriétaire34,4 %24 novembre 2025✅ Mesuré
15Claude Sonnet 4.5Anthropic🔒 Propriétaire23,9 %29 septembre 2025✅ Mesuré
16GPT-5 nanoOpenAI🔒 Propriétaire20,0 %7 août 2025✅ Mesuré
17Claude Opus 4.1Anthropic🔒 Propriétaire12,6 %5 août 2025✅ Mesuré

Classement établi sur 17 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 55,4 %.

Notre analyse

Un score élevé indique qu’un modèle fournit fréquemment la réponse exacte attendue sur ces problèmes, sans crédit partiel pour une démarche incomplète. Cette règle rend l’évaluation stricte, mais réduit la performance à la correction finale. Les scores sont au moins partiellement mesurés par un tiers, ce qui apporte davantage d’indépendance qu’un classement reposant uniquement sur des résultats auto-déclarés.

Le caractère privé du jeu de test et la non-divulgation des réponses limitent les possibilités de contamination directe. Ils ne permettent toutefois pas d’en déduire une absence absolue de contamination. La portée reste ciblée sur le raisonnement mathématique avancé en anglais et sur des réponses exactes, sans représenter l’ensemble des capacités d’un modèle. Avec une médiane de 58 % parmi les 36 modèles évalués et un meilleur résultat de 89 % pour GPT-5.6 Sol, le classement montre une forte marge entre la performance centrale et la tête. L’écart restant jusqu’au score maximal indique aussi que le benchmark n’est pas saturé par son meilleur modèle.


Sources des scores : epoch.