FrontierMath-Tier-4-v2-Private
Epoch: FrontierMath-Tier-4-v2-Private est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques originaux de très haut niveau. Il repose sur des questions ouvertes, formulées en anglais, dont les réponses sont courtes ou vérifiables.
Epoch: FrontierMath-Tier-4-v2-Private est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques originaux de très haut niveau. Il repose sur des questions ouvertes, formulées en anglais, dont les réponses sont courtes ou vérifiables.
Ce sous-ensemble privé de FrontierMath mesure un raisonnement avancé, souvent associé à des outils formels ou calculatoires. La non-divulgation des questions et des réponses en fait un test destiné à comparer les modèles d’IA de pointe sur des tâches mathématiques particulièrement exigeantes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Mesure la capacité des modèles à résoudre des problèmes mathématiques originaux de très haut niveau, nécessitant un raisonnement avancé et souvent des outils formels ou calculatoires. |
| Modalité | Texte |
| Type de questions | questions ouvertes de mathématiques avancées à réponse courte ou vérifiable |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 82,9 % | 9 juillet 2026 | ✅ Mesuré |
| 2 | AI co-mathematician | ▫ n.d. | 75,6 % | 8 mai 2026 | ✅ Mesuré | |
| 3 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 70,7 % | 9 juillet 2026 | ✅ Mesuré |
| 4 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 61,0 % | 9 juillet 2026 | ✅ Mesuré |
| 5 | OpenAI: GPT-5.4 Pro | OpenAI | 🔒 Propriétaire | 58,5 % | 5 mars 2026 | ✅ Mesuré |
| 6 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 31,7 % | 11 décembre 2025 | ✅ Mesuré |
| 7 | Gemini 3.1 Pro Preview | ▫ n.d. | 26,8 % | 19 février 2026 | ✅ Mesuré | |
| 8 | Grok 4.5 | xAI | 🔒 Propriétaire | 24,4 % | 16 juillet 2026 | ✅ Mesuré |
| 9 | GPT-5 | OpenAI | 🔒 Propriétaire | 22,0 % | 7 août 2025 | ✅ Mesuré |
| 10 | OpenAI: GPT-5 Pro | OpenAI | 🔒 Propriétaire | 19,5 % | 6 octobre 2025 | ✅ Mesuré |
| 11 | Grok 4.20 | xAI | ▫ n.d. | 17,1 % | 31 mars 2026 | ✅ Mesuré |
| 12 | Grok 4.3 Beta | xAI | ▫ n.d. | 14,6 % | 17 avril 2026 | ✅ Mesuré |
| 13 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 12,2 % | 7 août 2025 | ✅ Mesuré |
| 14 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 4,9 % | 24 novembre 2025 | ✅ Mesuré |
| 15 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 2,4 % | 5 août 2025 | ✅ Mesuré |
| 16 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 2,4 % | 29 septembre 2025 | ✅ Mesuré |
| 17 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 2,4 % | 24 avril 2026 | ✅ Mesuré |
| 18 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 2,4 % | 7 août 2025 | ✅ Mesuré |
Classement établi sur 18 modèles évalués, dont 18 de grands éditeurs. Score médian de l'ensemble : 20,7 %.
Notre analyse
Un score élevé indique qu’un modèle résout correctement une forte proportion de problèmes mathématiques originaux et difficiles, selon la métrique d’accuracy. Les scores étant au moins partiellement mesurés par un tiers, l’évaluation ne repose pas uniquement sur des résultats auto-déclarés, ce qui renforce la valeur comparative du classement. Le caractère privé du jeu de test, avec des réponses non divulguées, limite l’exposition directe de son contenu et donc certains risques de contamination.
La médiane de 27 % parmi les 37 modèles évalués confirme le niveau d’exigence du benchmark. Le résultat de Claude Fable 5, à 88 %, révèle un écart important avec la performance médiane, tout en laissant une marge avant une saturation complète. Le classement distingue ainsi fortement les capacités de raisonnement mathématique avancé. Sa portée reste toutefois ciblée : il mesure des problèmes de mathématiques avancées en anglais, à réponse courte ou vérifiable, et ne constitue pas une mesure générale de l’ensemble des capacités d’un modèle.
Sources des scores : epoch.