FrontierMath-Tiers-1-3-v2-Private
Epoch: FrontierMath-Tiers-1-3-v2-Private est un benchmark créé par Epoch AI pour évaluer le raisonnement mathématique avancé, depuis le niveau du premier cycle universitaire jusqu’à des problèmes exploratoires de niveau doctoral.
Epoch: FrontierMath-Tiers-1-3-v2-Private est un benchmark créé par Epoch AI pour évaluer le raisonnement mathématique avancé, depuis le niveau du premier cycle universitaire jusqu’à des problèmes exploratoires de niveau doctoral.
Il repose sur des problèmes de recherche en anglais exigeant une réponse exacte, numérique ou symbolique. Son évaluation binaire distingue strictement les réponses correctes des réponses incorrectes. Cet ensemble privé et tenu à l’écart sert ainsi à comparer la capacité des modèles à résoudre rigoureusement des questions mathématiques complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Raisonnement mathematique avance, du niveau premier cycle aux problemes exploratoires de niveau doctorat |
| Modalité | Texte |
| Type de questions | problemes mathematiques de recherche a reponse exacte (numerique/symbolique) |
| Métrique d'évaluation | exactitude binaire (1 si correct, 0 sinon) |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | propriétaire |
| Langues | anglais |
| Taille du jeu | 295 problemes (ensemble prive Tiers 1-3 v2) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (17)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 89,1 % | 9 juillet 2026 | ✅ Mesuré |
| 2 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 86,0 % | 9 juillet 2026 | ✅ Mesuré |
| 3 | OpenAI: GPT-5.4 Pro | OpenAI | 🔒 Propriétaire | 82,5 % | 5 mars 2026 | ✅ Mesuré |
| 4 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 82,1 % | 9 juillet 2026 | ✅ Mesuré |
| 5 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 67,4 % | 11 décembre 2025 | ✅ Mesuré |
| 6 | Gemini 3.1 Pro Preview | ▫ n.d. | 59,6 % | 19 février 2026 | ✅ Mesuré | |
| 7 | Grok 4.5 | xAI | 🔒 Propriétaire | 57,2 % | 16 juillet 2026 | ✅ Mesuré |
| 8 | OpenAI: GPT-5 Pro | OpenAI | 🔒 Propriétaire | 55,8 % | 6 octobre 2025 | ✅ Mesuré |
| 9 | GPT-5 | OpenAI | 🔒 Propriétaire | 55,4 % | 7 août 2025 | ✅ Mesuré |
| 10 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 46,7 % | 7 août 2025 | ✅ Mesuré |
| 11 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 45,3 % | 24 avril 2026 | ✅ Mesuré |
| 12 | Grok 4.20 | xAI | ▫ n.d. | 44,9 % | 31 mars 2026 | ✅ Mesuré |
| 13 | Grok 4.3 Beta | xAI | ▫ n.d. | 42,8 % | 17 avril 2026 | ✅ Mesuré |
| 14 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 34,4 % | 24 novembre 2025 | ✅ Mesuré |
| 15 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 23,9 % | 29 septembre 2025 | ✅ Mesuré |
| 16 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 20,0 % | 7 août 2025 | ✅ Mesuré |
| 17 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 12,6 % | 5 août 2025 | ✅ Mesuré |
Classement établi sur 17 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 55,4 %.
Notre analyse
Un score élevé indique qu’un modèle fournit fréquemment la réponse exacte attendue sur ces problèmes, sans crédit partiel pour une démarche incomplète. Cette règle rend l’évaluation stricte, mais réduit la performance à la correction finale. Les scores sont au moins partiellement mesurés par un tiers, ce qui apporte davantage d’indépendance qu’un classement reposant uniquement sur des résultats auto-déclarés.
Le caractère privé du jeu de test et la non-divulgation des réponses limitent les possibilités de contamination directe. Ils ne permettent toutefois pas d’en déduire une absence absolue de contamination. La portée reste ciblée sur le raisonnement mathématique avancé en anglais et sur des réponses exactes, sans représenter l’ensemble des capacités d’un modèle. Avec une médiane de 58 % parmi les 36 modèles évalués et un meilleur résultat de 89 % pour GPT-5.6 Sol, le classement montre une forte marge entre la performance centrale et la tête. L’écart restant jusqu’au score maximal indique aussi que le benchmark n’est pas saturé par son meilleur modèle.
Sources des scores : epoch.