FrontierMath-2025-02-28-Private
Epoch: FrontierMath-2025-02-28-Private est un snapshot du jeu privé FrontierMath créé par Epoch AI. Il rassemble des problèmes mathématiques originaux et extrêmement difficiles, conçus et vérifiés par des mathématiciens experts, dans des domaines comme la théorie des nombres, l’analyse…
Epoch: FrontierMath-2025-02-28-Private est un snapshot du jeu privé FrontierMath créé par Epoch AI. Il rassemble des problèmes mathématiques originaux et extrêmement difficiles, conçus et vérifiés par des mathématiciens experts, dans des domaines comme la théorie des nombres, l’analyse réelle, la géométrie algébrique et la théorie des catégories.
Le benchmark mesure la capacité des modèles à résoudre des problèmes de niveau recherche produisant une réponse numérique ou symbolique, soumise sous forme d’objet Python. Son exactitude binaire en fait un test direct du raisonnement mathématique avancé.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Raisonnement mathématique avancé de niveau recherche (théorie des nombres, analyse réelle, géométrie algébrique, théorie des catégories). |
| Modalité | Texte |
| Type de questions | Problèmes ouverts à réponse numérique/symbolique (soumis comme objets Python) |
| Métrique d'évaluation | Exactitude binaire (% de problèmes résolus, 1/0 par problème) |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | propriétaire |
| Langues | Anglais |
| Taille du jeu | ≈300 problèmes (jeu privé ; FrontierMath comptait ~350 problèmes Tiers 1-4 à l'origine) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (32)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | OpenAI: GPT-5.4 Pro | OpenAI | 🔒 Propriétaire | 50,0 % | 5 mars 2026 | ✅ Mesuré |
| 2 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 40,7 % | 11 décembre 2025 | ✅ Mesuré |
| 3 | Gemini 3.1 Pro Preview | ▫ n.d. | 36,9 % | 19 février 2026 | ✅ Mesuré | |
| 4 | GPT-5 | OpenAI | 🔒 Propriétaire | 32,4 % | 7 août 2025 | ✅ Mesuré |
| 5 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 31,0 % | 13 novembre 2025 | ✅ Mesuré |
| 6 | Gemini 2.5 Deep Think | ▫ n.d. | 29,0 % | 1 août 2025 | ✅ Mesuré | |
| 7 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 27,2 % | 7 août 2025 | ✅ Mesuré |
| 8 | Qwen 3.6 Max | Qwen | ▫ n.d. | 23,1 % | 20 avril 2026 | ✅ Mesuré |
| 9 | Kimi K2 | Moonshot AI | ▫ n.d. | 21,4 % | 6 novembre 2025 | ✅ Mesuré |
| 10 | Qwen 3.5 Plus | Qwen | ▫ n.d. | 21,0 % | 16 février 2026 | ✅ Mesuré |
| 11 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 20,7 % | 24 novembre 2025 | ✅ Mesuré |
| 12 | o3 | OpenAI | 🔒 Propriétaire | 18,7 % | 16 avril 2025 | ✅ Mesuré |
| 13 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 15,2 % | 29 septembre 2025 | ✅ Mesuré |
| 14 | Gemini 2.5 Pro Preview | ▫ n.d. | 10,3 % | 5 juin 2025 | ✅ Mesuré | |
| 15 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 10,3 % | 27 avril 2026 | ✅ Mesuré |
| 16 | o1 | OpenAI | 🔒 Propriétaire | 9,3 % | 17 décembre 2024 | ✅ Mesuré |
| 17 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 8,3 % | 7 août 2025 | ✅ Mesuré |
| 18 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 7,2 % | 5 août 2025 | ✅ Mesuré |
| 19 | Qwen: Qwen3.5-Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 6,2 % | 25 février 2026 | ✅ Mesuré |
| 20 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 5,9 % | 15 octobre 2025 | ✅ Mesuré |
| 21 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 5,5 % | 14 avril 2025 | ✅ Mesuré |
| 22 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 4,5 % | 22 mai 2025 | ✅ Mesuré |
| 23 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 4,5 % | 14 avril 2025 | ✅ Mesuré |
| 24 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 4,1 % | 24 février 2025 | ✅ Mesuré |
| 25 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 4,1 % | 22 mai 2025 | ✅ Mesuré |
| 26 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 2,1 % | 22 octobre 2024 | ✅ Mesuré |
| 27 | qwen-plus-2025-01-25 | Alibaba Cloud / Qwen Team | ▫ n.d. | 1,7 % | 8 septembre 2025 | ✅ Mesuré |
| 28 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 1,0 % | 14 avril 2025 | ✅ Mesuré |
| 29 | qwen2.5-max | Qwen | ▫ n.d. | 1,0 % | 25 janvier 2025 | ✅ Mesuré |
| 30 | Mistral: Mistral Medium 3 | Mistral AI | ▫ n.d. | 0,3 % | 7 mai 2025 | ✅ Mesuré |
| 31 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 0,3 % | 4 novembre 2024 | ✅ Mesuré |
| 32 | GPT-4o | OpenAI | 🔒 Propriétaire | 0,3 % | 27 mars 2025 | ✅ Mesuré |
Classement établi sur 32 modèles évalués, dont 28 de grands éditeurs. Score médian de l'ensemble : 8,8 %.
Notre analyse
Un score élevé indique qu’un modèle résout correctement une part importante de problèmes de niveau recherche, selon un verdict strict de réussite ou d’échec pour chaque exercice. Cette métrique réduit l’ambiguïté du résultat, tandis que la conception et la vérification par des mathématiciens experts renforcent la rigueur du jeu. Les scores sont au moins partiellement mesurés par un tiers, ce qui leur confère une assise plus indépendante que des résultats uniquement auto-déclarés.
Le caractère privé du test, la non-divulgation des réponses et la vérification automatisée visent à limiter la contamination. Celle-ci ne peut toutefois être présentée comme totalement éliminée. Le classement de 69 modèles montre une forte difficulté persistante : avec une médiane à 14 % et GPT-5.5 Pro en tête à 52 %, le benchmark reste loin d’une saturation générale. L’écart entre le meilleur résultat et le niveau médian révèle une différenciation nette des capacités. Sa portée demeure spécialisée : il évalue le raisonnement mathématique avancé dans les domaines couverts, plutôt que les performances générales des modèles.
Sources des scores : epoch.