Mathematics
LiveBench: Mathematics est la catégorie consacrée aux mathématiques de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle s’appuie sur des compétitions mathématiques récentes afin de limiter…
LiveBench: Mathematics est la catégorie consacrée aux mathématiques de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle s’appuie sur des compétitions mathématiques récentes afin de limiter la contamination des modèles par les données d’entraînement.
Le benchmark mesure la résolution de problèmes de type AMC/AIME, de démonstrations et de versions durcies de jeux existants. Sa vérité-terrain objective et vérifiable permet une notation automatique sans juge LLM, pour comparer les capacités de raisonnement mathématique des modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Abacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench) |
| Capacités mesurées | Resolution de problemes mathematiques issus de competitions recentes et versions durcies de benchmarks existants |
| Modalité | Texte |
| Type de questions | Problemes mathematiques (competitions recentes type AMC/AIME, demonstrations, etc.) |
| Métrique d'évaluation | Scoring automatique sur verite-terrain objective et verifiable, sans juge LLM |
| Accès | Public |
| Licence | Apache-2.0 (depot avec composants sous MIT) |
| Langues | anglais |
| Taille du jeu | 40-100 questions par tache (plusieurs taches par categorie) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 93,2 % | 11 décembre 2025 | ✅ Mesuré |
| 2 | Gemini 3.1 Pro Preview | ▫ n.d. | 91,0 % | 19 février 2026 | ✅ Mesuré | |
| 3 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 90,7 % | 24 avril 2026 | ✅ Mesuré |
| 4 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 90,4 % | 24 novembre 2025 | ✅ Mesuré |
| 5 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 84,3 % | — | ✅ Mesuré |
| 6 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 79,6 % | 24 avril 2026 | ✅ Mesuré |
| 7 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 78,4 % | 20 mai 2026 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 90,4 %.
Notre analyse
Un score élevé indique qu’un modèle résout correctement une forte proportion des problèmes mathématiques proposés selon les réponses de référence. La notation automatique, fondée sur une vérité-terrain objective et vérifiable, renforce la cohérence de l’évaluation et évite la variabilité d’un juge LLM. Toutefois, les scores recensés sont majoritairement auto-déclarés par les éditeurs, ce qui distingue la rigueur du protocole de notation de la provenance des résultats publiés. Avec une médiane de 89 % parmi 26 modèles et un meilleur résultat de 96 % pour GPT-5.5, le classement montre des performances élevées et un écart limité entre le niveau central et le sommet. Cette concentration suggère une saturation partielle, susceptible de réduire le pouvoir discriminant du benchmark entre les modèles les plus performants. Le recours à des compétitions récentes vise à limiter la contamination, sans modifier la portée de l’évaluation, centrée sur des problèmes mathématiques en anglais. Le classement renseigne donc spécifiquement sur cette capacité, dans le cadre des tâches sélectionnées.
Sources des scores : livebench.