Global average

LiveBench: Global average est un benchmark dynamique créé en 2024 par la LiveBench team et Abacus.AI. Il évalue les capacités générales des modèles de langage à partir de tâches récentes et variées, renouvelées régulièrement afin de limiter la contamination par les données d’entraînement.

LiveBench: Global average est un benchmark dynamique créé en 2024 par la LiveBench team et Abacus.AI. Il évalue les capacités générales des modèles de langage à partir de tâches récentes et variées, renouvelées régulièrement afin de limiter la contamination par les données d’entraînement.

Son score global synthétise les performances en raisonnement, mathématiques, codage, compréhension linguistique, suivi d’instructions et analyse de données. Il fournit ainsi un indicateur transversal pour comparer les modèles sur plusieurs formes de questions et méthodes d’évaluation.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkLiveBench team / Abacus.AI
Capacités mesuréesMesure les capacités générales des modèles de langage sur des tâches récentes et variées, notamment raisonnement, mathématiques, codage, compréhension linguistique, suivi d’instructions et analyse de données.
ModalitéTexte
Type de questionsmélange de questions ouvertes à réponse courte, problèmes de mathématiques et de raisonnement, génération de code, instruction following et tâches évaluées automatiquement ou par juge
Métrique d'évaluationmoyenne globale des scores normalisés sur 100
AccèsPublic
Languesanglais
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.77,1 %19 février 2026✅ Mesuré
2GPT-5.2OpenAI🔒 Propriétaire74,6 %11 décembre 2025✅ Mesuré
3Claude Opus 4.5Anthropic🔒 Propriétaire72,6 %24 novembre 2025✅ Mesuré
4DeepSeek V4 ProDeepSeek▫ n.d.71,6 %24 avril 2026✅ Mesuré
5Kimi K2.6 ThinkingMoonshot AI▫ n.d.70,5 %✅ Mesuré
6xAI: Grok Build 0.1xAI▫ n.d.67,8 %20 mai 2026✅ Mesuré
7DeepSeek V4 FlashDeepSeek▫ n.d.65,5 %24 avril 2026✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 71,6 %.

Notre analyse

Un score élevé traduit des performances solides et relativement homogènes dans l’ensemble des catégories, puisque le résultat correspond à une moyenne de scores normalisés sur 100. Il ne garantit toutefois pas une supériorité sur chaque tâche prise séparément. L’ajout régulier de questions récentes renforce la pertinence de l’évaluation et vise à réduire la contamination, sans faire de cette précaution une garantie absolue.

La rigueur de la comparaison doit aussi être nuancée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Le benchmark combine des évaluations automatiques et par juge, selon les tâches. Sa portée couvre plusieurs capacités générales, mais uniquement en anglais. Dans la base considérée, la médiane atteint 73 %, tandis que GPT-5.5 obtient le meilleur score à 80 %. Cet écart resserré indique un classement concentré dans sa partie supérieure et peut limiter la différenciation entre modèles performants, signe possible de saturation. Le classement révèle donc surtout leur niveau relatif sur l’agrégat LiveBench, plutôt qu’une mesure exhaustive de toutes leurs capacités.


Sources des scores : livebench.