FrontierMath

FrontierMath est un benchmark créé en 2024 par Epoch AI pour évaluer le raisonnement mathématique avancé des modèles d’intelligence artificielle. Il réunit des problèmes originaux, particulièrement difficiles, conçus et vérifiés par des mathématiciens experts.

FrontierMath est un benchmark créé en 2024 par Epoch AI pour évaluer le raisonnement mathématique avancé des modèles d’intelligence artificielle. Il réunit des problèmes originaux, particulièrement difficiles, conçus et vérifiés par des mathématiciens experts.

Ses questions ouvertes couvrent de nombreuses branches des mathématiques modernes, de la théorie des nombres et de l’analyse réelle à la géométrie algébrique et à la théorie des catégories. Les réponses, courtes ou vérifiables, permettent de comparer la capacité des modèles à résoudre des problèmes exigeants au-delà des évaluations mathématiques courantes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes de mathématiques avancées à réponse courte ou vérifiable
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Licencepropriétaire
Languesanglais
Taille du jeuplusieurs centaines de problèmes
Année de publication2024
RessourcesSite / dépôt officiel

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (16)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire89,0 %9 juillet 2026Auto-déclaré
2GPT-5.6 TerraOpenAI🔒 Propriétaire84,9 %9 juillet 2026Auto-déclaré
3GPT-5.6 LunaOpenAI🔒 Propriétaire78,6 %9 juillet 2026Auto-déclaré
4GPT-4.5OpenAI🔒 Propriétaire47,6 %5 mars 2026Auto-déclaré
5GPT-5.2OpenAI🔒 Propriétaire40,3 %11 décembre 2025Auto-déclaré
6GPT-5.5 ProOpenAI🔒 Propriétaire39,6 %23 avril 2026Auto-déclaré
7GPT-5.5OpenAI🔒 Propriétaire35,4 %23 avril 2026Auto-déclaré
8GPT-5.1OpenAI🔒 Propriétaire26,7 %13 novembre 2025Auto-déclaré
9GPT-5.1 InstantOpenAI🔒 Propriétaire26,7 %12 novembre 2025Auto-déclaré
10GPT-5OpenAI🔒 Propriétaire26,3 %7 août 2025Auto-déclaré
11GPT-5 miniOpenAI🔒 Propriétaire22,1 %7 août 2025Auto-déclaré
12o3OpenAI🔒 Propriétaire15,8 %16 avril 2025Auto-déclaré
13GPT-5 nanoOpenAI🔒 Propriétaire9,6 %7 août 2025Auto-déclaré
14o3-miniOpenAI🔒 Propriétaire9,2 %30 janvier 2025Auto-déclaré
15MAI-Code-1-FlashMicrosoft🔒 Propriétaire6,3 %2 juin 2026Auto-déclaré
16o1OpenAI🔒 Propriétaire5,5 %17 décembre 2024Auto-déclaré

Classement établi sur 16 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 26,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur FrontierMath indique qu’un modèle résout correctement une part importante de problèmes mathématiques originaux et très difficiles, selon une métrique d’accuracy. Le meilleur résultat observé, 48 % pour GPT-5.4, reste inférieur à la moitié du jeu, tandis que la médiane des 13 modèles évalués atteint 26 %. Cet écart révèle une différenciation nette entre les modèles et montre que le benchmark n’est pas saturé par les résultats recensés. L’interprétation du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le caractère privé du jeu de test et la non-divulgation des réponses limitent l’exposition directe des solutions, ce qui contribue à réduire le risque de contamination. La portée reste ciblée sur le raisonnement mathématique avancé, à travers des réponses courtes ou vérifiables formulées en anglais. FrontierMath renseigne donc sur cette compétence spécialisée, sans constituer une mesure générale de l’ensemble des capacités d’un modèle.


Sources des scores : llm-stats.