FrontierMath-Tier-4-v2-Private

Epoch: FrontierMath-Tier-4-v2-Private est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques originaux de très haut niveau. Il repose sur des questions ouvertes, formulées en anglais, dont les réponses sont courtes ou vérifiables.

Epoch: FrontierMath-Tier-4-v2-Private est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques originaux de très haut niveau. Il repose sur des questions ouvertes, formulées en anglais, dont les réponses sont courtes ou vérifiables.

Ce sous-ensemble privé de FrontierMath mesure un raisonnement avancé, souvent associé à des outils formels ou calculatoires. La non-divulgation des questions et des réponses en fait un test destiné à comparer les modèles d’IA de pointe sur des tâches mathématiques particulièrement exigeantes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesMesure la capacité des modèles à résoudre des problèmes mathématiques originaux de très haut niveau, nécessitant un raisonnement avancé et souvent des outils formels ou calculatoires.
ModalitéTexte
Type de questionsquestions ouvertes de mathématiques avancées à réponse courte ou vérifiable
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire82,9 %9 juillet 2026✅ Mesuré
2AI co-mathematicianGoogle▫ n.d.75,6 %8 mai 2026✅ Mesuré
3GPT-5.6 TerraOpenAI🔒 Propriétaire70,7 %9 juillet 2026✅ Mesuré
4GPT-5.6 LunaOpenAI🔒 Propriétaire61,0 %9 juillet 2026✅ Mesuré
5OpenAI: GPT-5.4 ProOpenAI🔒 Propriétaire58,5 %5 mars 2026✅ Mesuré
6GPT-5.2OpenAI🔒 Propriétaire31,7 %11 décembre 2025✅ Mesuré
7Gemini 3.1 Pro PreviewGoogle▫ n.d.26,8 %19 février 2026✅ Mesuré
8Grok 4.5xAI🔒 Propriétaire24,4 %16 juillet 2026✅ Mesuré
9GPT-5OpenAI🔒 Propriétaire22,0 %7 août 2025✅ Mesuré
10OpenAI: GPT-5 ProOpenAI🔒 Propriétaire19,5 %6 octobre 2025✅ Mesuré
11Grok 4.20xAI▫ n.d.17,1 %31 mars 2026✅ Mesuré
12Grok 4.3 BetaxAI▫ n.d.14,6 %17 avril 2026✅ Mesuré
13GPT-5 miniOpenAI🔒 Propriétaire12,2 %7 août 2025✅ Mesuré
14Claude Opus 4.5Anthropic🔒 Propriétaire4,9 %24 novembre 2025✅ Mesuré
15Claude Opus 4.1Anthropic🔒 Propriétaire2,4 %5 août 2025✅ Mesuré
16Claude Sonnet 4.5Anthropic🔒 Propriétaire2,4 %29 septembre 2025✅ Mesuré
17DeepSeek V4 ProDeepSeek▫ n.d.2,4 %24 avril 2026✅ Mesuré
18GPT-5 nanoOpenAI🔒 Propriétaire2,4 %7 août 2025✅ Mesuré

Classement établi sur 18 modèles évalués, dont 18 de grands éditeurs. Score médian de l'ensemble : 20,7 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une forte proportion de problèmes mathématiques originaux et difficiles, selon la métrique d’accuracy. Les scores étant au moins partiellement mesurés par un tiers, l’évaluation ne repose pas uniquement sur des résultats auto-déclarés, ce qui renforce la valeur comparative du classement. Le caractère privé du jeu de test, avec des réponses non divulguées, limite l’exposition directe de son contenu et donc certains risques de contamination.

La médiane de 27 % parmi les 37 modèles évalués confirme le niveau d’exigence du benchmark. Le résultat de Claude Fable 5, à 88 %, révèle un écart important avec la performance médiane, tout en laissant une marge avant une saturation complète. Le classement distingue ainsi fortement les capacités de raisonnement mathématique avancé. Sa portée reste toutefois ciblée : il mesure des problèmes de mathématiques avancées en anglais, à réponse courte ou vérifiable, et ne constitue pas une mesure générale de l’ensemble des capacités d’un modèle.


Sources des scores : epoch.