FrontierMath
FrontierMath est un benchmark créé en 2024 par Epoch AI pour évaluer le raisonnement mathématique avancé des modèles d’intelligence artificielle. Il réunit des problèmes originaux, particulièrement difficiles, conçus et vérifiés par des mathématiciens experts.
FrontierMath est un benchmark créé en 2024 par Epoch AI pour évaluer le raisonnement mathématique avancé des modèles d’intelligence artificielle. Il réunit des problèmes originaux, particulièrement difficiles, conçus et vérifiés par des mathématiciens experts.
Ses questions ouvertes couvrent de nombreuses branches des mathématiques modernes, de la théorie des nombres et de l’analyse réelle à la géométrie algébrique et à la théorie des catégories. Les réponses, courtes ou vérifiables, permettent de comparer la capacité des modèles à résoudre des problèmes exigeants au-delà des évaluations mathématiques courantes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes de mathématiques avancées à réponse courte ou vérifiable |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | propriétaire |
| Langues | anglais |
| Taille du jeu | plusieurs centaines de problèmes |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (16)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 89,0 % | 9 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 84,9 % | 9 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 78,6 % | 9 juillet 2026 | Auto-déclaré |
| 4 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 47,6 % | 5 mars 2026 | Auto-déclaré |
| 5 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 40,3 % | 11 décembre 2025 | Auto-déclaré |
| 6 | GPT-5.5 Pro | OpenAI | 🔒 Propriétaire | 39,6 % | 23 avril 2026 | Auto-déclaré |
| 7 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 35,4 % | 23 avril 2026 | Auto-déclaré |
| 8 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 26,7 % | 13 novembre 2025 | Auto-déclaré |
| 9 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 26,7 % | 12 novembre 2025 | Auto-déclaré |
| 10 | GPT-5 | OpenAI | 🔒 Propriétaire | 26,3 % | 7 août 2025 | Auto-déclaré |
| 11 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 22,1 % | 7 août 2025 | Auto-déclaré |
| 12 | o3 | OpenAI | 🔒 Propriétaire | 15,8 % | 16 avril 2025 | Auto-déclaré |
| 13 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 9,6 % | 7 août 2025 | Auto-déclaré |
| 14 | o3-mini | OpenAI | 🔒 Propriétaire | 9,2 % | 30 janvier 2025 | Auto-déclaré |
| 15 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 6,3 % | 2 juin 2026 | Auto-déclaré |
| 16 | o1 | OpenAI | 🔒 Propriétaire | 5,5 % | 17 décembre 2024 | Auto-déclaré |
Classement établi sur 16 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 26,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur FrontierMath indique qu’un modèle résout correctement une part importante de problèmes mathématiques originaux et très difficiles, selon une métrique d’accuracy. Le meilleur résultat observé, 48 % pour GPT-5.4, reste inférieur à la moitié du jeu, tandis que la médiane des 13 modèles évalués atteint 26 %. Cet écart révèle une différenciation nette entre les modèles et montre que le benchmark n’est pas saturé par les résultats recensés. L’interprétation du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le caractère privé du jeu de test et la non-divulgation des réponses limitent l’exposition directe des solutions, ce qui contribue à réduire le risque de contamination. La portée reste ciblée sur le raisonnement mathématique avancé, à travers des réponses courtes ou vérifiables formulées en anglais. FrontierMath renseigne donc sur cette compétence spécialisée, sans constituer une mesure générale de l’ensemble des capacités d’un modèle.
Sources des scores : llm-stats.