FrontierMath-2025-02-28-Public
Epoch: FrontierMath-2025-02-28-Public est un sous-ensemble public de FrontierMath, créé par Epoch AI. Il rassemble quelques problèmes ouverts en anglais, présentés sous forme d’objets Python, afin d’illustrer et de tester le raisonnement mathématique avancé de niveau recherche.
Epoch: FrontierMath-2025-02-28-Public est un sous-ensemble public de FrontierMath, créé par Epoch AI. Il rassemble quelques problèmes ouverts en anglais, présentés sous forme d’objets Python, afin d’illustrer et de tester le raisonnement mathématique avancé de niveau recherche.
Ce benchmark sert à comparer la capacité des modèles à produire une réponse numérique ou symbolique exacte dans les mêmes domaines que FrontierMath. Il offre ainsi un aperçu public d’une évaluation dont l’essentiel reste privé, avec un verdict binaire pour chaque problème.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Raisonnement mathématique avancé de niveau recherche (mêmes domaines que FrontierMath, échantillon public d'exemples). |
| Modalité | Texte |
| Type de questions | Problèmes ouverts à réponse numérique/symbolique (soumis comme objets Python) |
| Métrique d'évaluation | Exactitude binaire (% de problèmes résolus, 1/0 par problème) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | Petit sous-ensemble public (une dizaine de problèmes rendus publics) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (33)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 88,9 % | 19 février 2026 | ✅ Mesuré | |
| 2 | GPT-5 | OpenAI | 🔒 Propriétaire | 70,0 % | 7 août 2025 | ✅ Mesuré |
| 3 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 60,0 % | 11 décembre 2025 | ✅ Mesuré |
| 4 | OpenAI: GPT-5 Pro | OpenAI | 🔒 Propriétaire | 60,0 % | 6 octobre 2025 | ✅ Mesuré |
| 5 | Qwen 3.5 Plus | Qwen | ▫ n.d. | 50,0 % | 16 février 2026 | ✅ Mesuré |
| 6 | Qwen 3.6 Max | Qwen | ▫ n.d. | 50,0 % | 20 avril 2026 | ✅ Mesuré |
| 7 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 40,0 % | 24 novembre 2025 | ✅ Mesuré |
| 8 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 40,0 % | 7 août 2025 | ✅ Mesuré |
| 9 | Kimi K2 | Moonshot AI | ▫ n.d. | 40,0 % | 6 novembre 2025 | ✅ Mesuré |
| 10 | Gemini 2.5 Pro Preview | ▫ n.d. | 30,0 % | 5 juin 2025 | ✅ Mesuré | |
| 11 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 20,0 % | 7 août 2025 | ✅ Mesuré |
| 12 | Kimi K2 Thinking Turbo | Moonshot AI | ▫ n.d. | 20,0 % | 6 novembre 2025 | ✅ Mesuré |
| 13 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 20,0 % | 27 avril 2026 | ✅ Mesuré |
| 14 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 10,0 % | 14 avril 2025 | ✅ Mesuré |
| 15 | Qwen: Qwen3.5-Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 10,0 % | 25 février 2026 | ✅ Mesuré |
| 16 | o3 | OpenAI | 🔒 Propriétaire | 10,0 % | 16 avril 2025 | ✅ Mesuré |
| 17 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 0,0 % | 4 novembre 2024 | ✅ Mesuré |
| 18 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 0,0 % | 22 octobre 2024 | ✅ Mesuré |
| 19 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 0,0 % | 24 février 2025 | ✅ Mesuré |
| 20 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 0,0 % | 15 octobre 2025 | ✅ Mesuré |
| 21 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 0,0 % | 22 mai 2025 | ✅ Mesuré |
| 22 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 0,0 % | 5 août 2025 | ✅ Mesuré |
| 23 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 0,0 % | 22 mai 2025 | ✅ Mesuré |
| 24 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 0,0 % | 29 septembre 2025 | ✅ Mesuré |
| 25 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 0,0 % | 14 avril 2025 | ✅ Mesuré |
| 26 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 0,0 % | 14 avril 2025 | ✅ Mesuré |
| 27 | GPT-4o | OpenAI | 🔒 Propriétaire | 0,0 % | 27 mars 2025 | ✅ Mesuré |
| 28 | Gemini 2.0 Pro Exp | ▫ n.d. | 0,0 % | 5 février 2025 | ✅ Mesuré | |
| 29 | Magistral Small 1.1 | Mistral AI | ▫ n.d. | 0,0 % | 10 juin 2025 | ✅ Mesuré |
| 30 | Mistral: Mistral Medium 3 | Mistral AI | ▫ n.d. | 0,0 % | 7 mai 2025 | ✅ Mesuré |
| 31 | o1 | OpenAI | 🔒 Propriétaire | 0,0 % | 17 décembre 2024 | ✅ Mesuré |
| 32 | qwen-plus-2025-01-25 | Alibaba Cloud / Qwen Team | ▫ n.d. | 0,0 % | 8 septembre 2025 | ✅ Mesuré |
| 33 | qwen2.5-max | Qwen | ▫ n.d. | 0,0 % | 25 janvier 2025 | ✅ Mesuré |
Classement établi sur 33 modèles évalués, dont 28 de grands éditeurs. Score médian de l'ensemble : 0,0 %.
Notre analyse
Un score élevé indique qu’un modèle résout exactement une grande proportion de ces problèmes de mathématiques avancées. La notation binaire impose une exigence stricte : chaque réponse est considérée comme correcte ou incorrecte, sans crédit partiel. La fiabilité est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que seulement auto-déclarés.
La portée reste toutefois limitée par la petite taille de l’échantillon public, qui ne représente que les quelques exemples publiés de FrontierMath. Un résultat peut donc varier fortement à la suite d’un seul problème réussi ou manqué. Le caractère public des questions crée aussi un risque de contamination, puisque ces exemples peuvent être intégrés aux données ou aux procédures d’entraînement. La présence d’un score parfait signale en outre une saturation au sommet sur ce sous-ensemble, sans signifier que le benchmark privé complet est saturé. Le classement met en évidence un fort contraste entre Claude Fable 5, qui résout tous les problèmes, et une médiane de 10 % parmi les 64 modèles évalués, révélant une difficulté encore marquée pour la majorité des systèmes.
Sources des scores : epoch.