FrontierMath-Tier-4-2025-07-01-Public
Epoch: FrontierMath-Tier-4-2025-07-01-Public est un sous-ensemble public du niveau le plus difficile de FrontierMath, créé par Epoch AI. Il rassemble des problèmes mathématiques de niveau recherche extrême, conçus comme des projets de recherche à court terme par des professeurs et des…
Epoch: FrontierMath-Tier-4-2025-07-01-Public est un sous-ensemble public du niveau le plus difficile de FrontierMath, créé par Epoch AI. Il rassemble des problèmes mathématiques de niveau recherche extrême, conçus comme des projets de recherche à court terme par des professeurs et des post-doctorants.
Le benchmark évalue la capacité des modèles à résoudre des problèmes ouverts produisant une réponse numérique ou symbolique, soumise sous forme d’objet Python. Il sert à distinguer les systèmes capables de mener un raisonnement mathématique avancé sur des tâches dont certaines pourraient résister à l’IA pendant des décennies.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Raisonnement mathématique de niveau recherche extrême : problèmes les plus difficiles de FrontierMath, certains pouvant rester non résolus par l'IA pendant des décennies. |
| Modalité | Texte |
| Type de questions | Problèmes ouverts à réponse numérique/symbolique (soumis comme objets Python) |
| Métrique d'évaluation | Exactitude binaire (% de problèmes résolus) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | Tier 4 : ~50 problèmes (sous-ensemble public restreint, ex. 2 problèmes rendus publics) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 0,0 % | 22 octobre 2024 | ✅ Mesuré |
| 2 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 0,0 % | 24 février 2025 | ✅ Mesuré |
| 3 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 0,0 % | 22 mai 2025 | ✅ Mesuré |
| 4 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 0,0 % | 22 mai 2025 | ✅ Mesuré |
| 5 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 0,0 % | 29 septembre 2025 | ✅ Mesuré |
| 6 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 0,0 % | 14 avril 2025 | ✅ Mesuré |
| 7 | GPT-5 | OpenAI | 🔒 Propriétaire | 0,0 % | 7 août 2025 | ✅ Mesuré |
| 8 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 0,0 % | 7 août 2025 | ✅ Mesuré |
| 9 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 0,0 % | 7 août 2025 | ✅ Mesuré |
| 10 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 0,0 % | 11 décembre 2025 | ✅ Mesuré |
| 11 | Gemini 2.5 Pro Preview | ▫ n.d. | 0,0 % | 5 juin 2025 | ✅ Mesuré | |
| 12 | Gemini 3.1 Pro Preview | ▫ n.d. | 0,0 % | 19 février 2026 | ✅ Mesuré | |
| 13 | Kimi K2 | Moonshot AI | ▫ n.d. | 0,0 % | 6 novembre 2025 | ✅ Mesuré |
| 14 | Qwen 3.6 Max | Qwen | ▫ n.d. | 0,0 % | 20 avril 2026 | ✅ Mesuré |
| 15 | o3 | OpenAI | 🔒 Propriétaire | 0,0 % | 16 avril 2025 | ✅ Mesuré |
Classement établi sur 15 modèles évalués, dont 14 de grands éditeurs. Score médian de l'ensemble : 0,0 %.
Notre analyse
Un score élevé indique qu’un modèle fournit exactement la réponse attendue sur une forte proportion de ces problèmes de recherche. L’exactitude étant binaire, une solution n’est comptabilisée que comme résolue ou non résolue. Les scores sont au moins partiellement mesurés par un tiers, ce qui apporte un contrôle externe au-delà d’une évaluation entièrement auto-déclarée.
Le classement révèle une distribution très polarisée : Claude Fable 5 atteint 100 %, tandis que le score médian des 36 modèles évalués reste à 0 %. Le plafond est donc atteint par le meilleur modèle, mais cette réussite ne traduit pas une saturation générale du benchmark. La portée des conclusions demeure liée à un Tier 4 d’environ 50 problèmes et à un sous-ensemble public restreint, dont seuls quelques exemples ont été rendus publics. Ce caractère public doit aussi être pris en compte dans l’interprétation d’un éventuel risque de contamination. Enfin, le résultat mesure spécifiquement la résolution exacte de problèmes mathématiques extrêmes en anglais, plutôt qu’une capacité générale sur l’ensemble des usages de l’IA.
Sources des scores : epoch.