FrontierMath-Tier-4-2025-07-01-Private
Epoch: FrontierMath-Tier-4-2025-07-01-Private est une variante privée de niveau 4 de FrontierMath, un benchmark créé par Epoch AI. Il réunit des problèmes mathématiques originaux, conçus par des experts et destinés aux modèles de pointe.
Epoch: FrontierMath-Tier-4-2025-07-01-Private est une variante privée de niveau 4 de FrontierMath, un benchmark créé par Epoch AI. Il réunit des problèmes mathématiques originaux, conçus par des experts et destinés aux modèles de pointe.
Ces questions ouvertes, à réponse courte et vérifiable, évaluent la capacité à mener un raisonnement mathématique avancé, souvent de niveau recherche. Le benchmark sert ainsi à différencier les modèles sur des tâches particulièrement exigeantes, sans divulgation publique des questions ni des réponses.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Mesure la capacité des modèles à résoudre des problèmes mathématiques originaux, très difficiles, nécessitant un raisonnement avancé et souvent de niveau recherche. |
| Modalité | Texte |
| Type de questions | questions ouvertes de mathématiques à réponse courte/vérifiable |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | propriétaire |
| Langues | anglais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (25)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | AI co-mathematician | ▫ n.d. | 47,9 % | 8 mai 2026 | ✅ Mesuré | |
| 2 | OpenAI: GPT-5.4 Pro | OpenAI | 🔒 Propriétaire | 37,5 % | 5 mars 2026 | ✅ Mesuré |
| 3 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 18,8 % | 11 décembre 2025 | ✅ Mesuré |
| 4 | Gemini 3.1 Pro Preview | ▫ n.d. | 16,7 % | 19 février 2026 | ✅ Mesuré | |
| 5 | OpenAI: GPT-5 Pro | OpenAI | 🔒 Propriétaire | 14,6 % | 6 octobre 2025 | ✅ Mesuré |
| 6 | GPT-5 | OpenAI | 🔒 Propriétaire | 12,5 % | 7 août 2025 | ✅ Mesuré |
| 7 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 12,5 % | 13 novembre 2025 | ✅ Mesuré |
| 8 | Gemini 2.5 Deep Think | ▫ n.d. | 10,4 % | 1 août 2025 | ✅ Mesuré | |
| 9 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 6,2 % | 7 août 2025 | ✅ Mesuré |
| 10 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 4,2 % | 22 mai 2025 | ✅ Mesuré |
| 11 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 4,2 % | 5 août 2025 | ✅ Mesuré |
| 12 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 4,2 % | 24 novembre 2025 | ✅ Mesuré |
| 13 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 4,2 % | 29 septembre 2025 | ✅ Mesuré |
| 14 | Qwen 3.6 Max | Qwen | ▫ n.d. | 4,2 % | 20 avril 2026 | ✅ Mesuré |
| 15 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 2,1 % | 15 octobre 2025 | ✅ Mesuré |
| 16 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 2,1 % | 7 août 2025 | ✅ Mesuré |
| 17 | Gemini 2.5 Pro Preview | ▫ n.d. | 2,1 % | 5 juin 2025 | ✅ Mesuré | |
| 18 | Qwen 3.5 Plus | Qwen | ▫ n.d. | 2,1 % | 16 février 2026 | ✅ Mesuré |
| 19 | o3 | OpenAI | 🔒 Propriétaire | 2,1 % | 16 avril 2025 | ✅ Mesuré |
| 20 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 0,0 % | 22 octobre 2024 | ✅ Mesuré |
| 21 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 0,0 % | 22 mai 2025 | ✅ Mesuré |
| 22 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 0,0 % | 14 avril 2025 | ✅ Mesuré |
| 23 | Kimi K2 | Moonshot AI | ▫ n.d. | 0,0 % | 6 novembre 2025 | ✅ Mesuré |
| 24 | Qwen: Qwen3.5-Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 0,0 % | 25 février 2026 | ✅ Mesuré |
| 25 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 0,0 % | 27 avril 2026 | ✅ Mesuré |
Classement établi sur 25 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 4,2 %.
Notre analyse
Un score élevé indique qu’un modèle résout correctement une part importante de problèmes mathématiques inédits et très difficiles. L’accuracy mesure directement la proportion de réponses exactes. La fiabilité du classement est renforcée par le fait que les scores sont, au moins en partie, mesurés par un tiers plutôt que seulement auto-déclarés.
Les résultats montrent une forte difficulté globale. Parmi les 55 modèles évalués, le score médian atteint 4 %, tandis que AI co-mathematician (Google) domine avec 48 %. Cet écart révèle une différenciation marquée entre le meilleur système et le niveau central de l’ensemble. Le meilleur résultat restant inférieur à la moitié des problèmes, le benchmark ne présente pas de saturation apparente dans cette base.
Le caractère privé des questions et la non-divulgation des réponses limitent leur exposition publique, ce qui contribue à réduire les risques de contamination. La portée reste toutefois ciblée sur des problèmes mathématiques en anglais, ouverts, courts et vérifiables. Le classement renseigne donc sur le raisonnement mathématique avancé dans ce cadre précis, et non sur les capacités générales des modèles.
Sources des scores : epoch.