FrontierMath-Tier-4-2025-07-01-Private

Epoch: FrontierMath-Tier-4-2025-07-01-Private est une variante privée de niveau 4 de FrontierMath, un benchmark créé par Epoch AI. Il réunit des problèmes mathématiques originaux, conçus par des experts et destinés aux modèles de pointe.

Epoch: FrontierMath-Tier-4-2025-07-01-Private est une variante privée de niveau 4 de FrontierMath, un benchmark créé par Epoch AI. Il réunit des problèmes mathématiques originaux, conçus par des experts et destinés aux modèles de pointe.

Ces questions ouvertes, à réponse courte et vérifiable, évaluent la capacité à mener un raisonnement mathématique avancé, souvent de niveau recherche. Le benchmark sert ainsi à différencier les modèles sur des tâches particulièrement exigeantes, sans divulgation publique des questions ni des réponses.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesMesure la capacité des modèles à résoudre des problèmes mathématiques originaux, très difficiles, nécessitant un raisonnement avancé et souvent de niveau recherche.
ModalitéTexte
Type de questionsquestions ouvertes de mathématiques à réponse courte/vérifiable
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Licencepropriétaire
Languesanglais
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (25)

#ModèleÉditeurLicenceScoreSortieFiabilité
1AI co-mathematicianGoogle▫ n.d.47,9 %8 mai 2026✅ Mesuré
2OpenAI: GPT-5.4 ProOpenAI🔒 Propriétaire37,5 %5 mars 2026✅ Mesuré
3GPT-5.2OpenAI🔒 Propriétaire18,8 %11 décembre 2025✅ Mesuré
4Gemini 3.1 Pro PreviewGoogle▫ n.d.16,7 %19 février 2026✅ Mesuré
5OpenAI: GPT-5 ProOpenAI🔒 Propriétaire14,6 %6 octobre 2025✅ Mesuré
6GPT-5OpenAI🔒 Propriétaire12,5 %7 août 2025✅ Mesuré
7GPT-5.1OpenAI🔒 Propriétaire12,5 %13 novembre 2025✅ Mesuré
8Gemini 2.5 Deep ThinkGoogle▫ n.d.10,4 %1 août 2025✅ Mesuré
9GPT-5 miniOpenAI🔒 Propriétaire6,2 %7 août 2025✅ Mesuré
10Claude Opus 4Anthropic🔒 Propriétaire4,2 %22 mai 2025✅ Mesuré
11Claude Opus 4.1Anthropic🔒 Propriétaire4,2 %5 août 2025✅ Mesuré
12Claude Opus 4.5Anthropic🔒 Propriétaire4,2 %24 novembre 2025✅ Mesuré
13Claude Sonnet 4.5Anthropic🔒 Propriétaire4,2 %29 septembre 2025✅ Mesuré
14Qwen 3.6 MaxQwen▫ n.d.4,2 %20 avril 2026✅ Mesuré
15Claude Haiku 4.5Anthropic🔒 Propriétaire2,1 %15 octobre 2025✅ Mesuré
16GPT-5 nanoOpenAI🔒 Propriétaire2,1 %7 août 2025✅ Mesuré
17Gemini 2.5 Pro PreviewGoogle▫ n.d.2,1 %5 juin 2025✅ Mesuré
18Qwen 3.5 PlusQwen▫ n.d.2,1 %16 février 2026✅ Mesuré
19o3OpenAI🔒 Propriétaire2,1 %16 avril 2025✅ Mesuré
20Claude 3.5 SonnetAnthropic🔒 Propriétaire0,0 %22 octobre 2024✅ Mesuré
21Claude Sonnet 4Anthropic🔒 Propriétaire0,0 %22 mai 2025✅ Mesuré
22GPT-4.1OpenAI🔒 Propriétaire0,0 %14 avril 2025✅ Mesuré
23Kimi K2Moonshot AI▫ n.d.0,0 %6 novembre 2025✅ Mesuré
24Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %25 février 2026✅ Mesuré
25Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %27 avril 2026✅ Mesuré

Classement établi sur 25 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 4,2 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une part importante de problèmes mathématiques inédits et très difficiles. L’accuracy mesure directement la proportion de réponses exactes. La fiabilité du classement est renforcée par le fait que les scores sont, au moins en partie, mesurés par un tiers plutôt que seulement auto-déclarés.

Les résultats montrent une forte difficulté globale. Parmi les 55 modèles évalués, le score médian atteint 4 %, tandis que AI co-mathematician (Google) domine avec 48 %. Cet écart révèle une différenciation marquée entre le meilleur système et le niveau central de l’ensemble. Le meilleur résultat restant inférieur à la moitié des problèmes, le benchmark ne présente pas de saturation apparente dans cette base.

Le caractère privé des questions et la non-divulgation des réponses limitent leur exposition publique, ce qui contribue à réduire les risques de contamination. La portée reste toutefois ciblée sur des problèmes mathématiques en anglais, ouverts, courts et vérifiables. Le classement renseigne donc sur le raisonnement mathématique avancé dans ce cadre précis, et non sur les capacités générales des modèles.


Sources des scores : epoch.