Mathematics

LiveBench: Mathematics est la catégorie consacrée aux mathématiques de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle s’appuie sur des compétitions mathématiques récentes afin de limiter…

LiveBench: Mathematics est la catégorie consacrée aux mathématiques de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle s’appuie sur des compétitions mathématiques récentes afin de limiter la contamination des modèles par les données d’entraînement.

Le benchmark mesure la résolution de problèmes de type AMC/AIME, de démonstrations et de versions durcies de jeux existants. Sa vérité-terrain objective et vérifiable permet une notation automatique sans juge LLM, pour comparer les capacités de raisonnement mathématique des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAbacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench)
Capacités mesuréesResolution de problemes mathematiques issus de competitions recentes et versions durcies de benchmarks existants
ModalitéTexte
Type de questionsProblemes mathematiques (competitions recentes type AMC/AIME, demonstrations, etc.)
Métrique d'évaluationScoring automatique sur verite-terrain objective et verifiable, sans juge LLM
AccèsPublic
LicenceApache-2.0 (depot avec composants sous MIT)
Languesanglais
Taille du jeu40-100 questions par tache (plusieurs taches par categorie)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.2OpenAI🔒 Propriétaire93,2 %11 décembre 2025✅ Mesuré
2Gemini 3.1 Pro PreviewGoogle▫ n.d.91,0 %19 février 2026✅ Mesuré
3DeepSeek V4 ProDeepSeek▫ n.d.90,7 %24 avril 2026✅ Mesuré
4Claude Opus 4.5Anthropic🔒 Propriétaire90,4 %24 novembre 2025✅ Mesuré
5Kimi K2.6 ThinkingMoonshot AI▫ n.d.84,3 %✅ Mesuré
6DeepSeek V4 FlashDeepSeek▫ n.d.79,6 %24 avril 2026✅ Mesuré
7xAI: Grok Build 0.1xAI▫ n.d.78,4 %20 mai 2026✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 90,4 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une forte proportion des problèmes mathématiques proposés selon les réponses de référence. La notation automatique, fondée sur une vérité-terrain objective et vérifiable, renforce la cohérence de l’évaluation et évite la variabilité d’un juge LLM. Toutefois, les scores recensés sont majoritairement auto-déclarés par les éditeurs, ce qui distingue la rigueur du protocole de notation de la provenance des résultats publiés. Avec une médiane de 89 % parmi 26 modèles et un meilleur résultat de 96 % pour GPT-5.5, le classement montre des performances élevées et un écart limité entre le niveau central et le sommet. Cette concentration suggère une saturation partielle, susceptible de réduire le pouvoir discriminant du benchmark entre les modèles les plus performants. Le recours à des compétitions récentes vise à limiter la contamination, sans modifier la portée de l’évaluation, centrée sur des problèmes mathématiques en anglais. Le classement renseigne donc spécifiquement sur cette capacité, dans le cadre des tâches sélectionnées.


Sources des scores : livebench.