Global average
LiveBench: Global average est un benchmark dynamique créé en 2024 par la LiveBench team et Abacus.AI. Il évalue les capacités générales des modèles de langage à partir de tâches récentes et variées, renouvelées régulièrement afin de limiter la contamination par les données d’entraînement.
LiveBench: Global average est un benchmark dynamique créé en 2024 par la LiveBench team et Abacus.AI. Il évalue les capacités générales des modèles de langage à partir de tâches récentes et variées, renouvelées régulièrement afin de limiter la contamination par les données d’entraînement.
Son score global synthétise les performances en raisonnement, mathématiques, codage, compréhension linguistique, suivi d’instructions et analyse de données. Il fournit ainsi un indicateur transversal pour comparer les modèles sur plusieurs formes de questions et méthodes d’évaluation.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | LiveBench team / Abacus.AI |
| Capacités mesurées | Mesure les capacités générales des modèles de langage sur des tâches récentes et variées, notamment raisonnement, mathématiques, codage, compréhension linguistique, suivi d’instructions et analyse de données. |
| Modalité | Texte |
| Type de questions | mélange de questions ouvertes à réponse courte, problèmes de mathématiques et de raisonnement, génération de code, instruction following et tâches évaluées automatiquement ou par juge |
| Métrique d'évaluation | moyenne globale des scores normalisés sur 100 |
| Accès | Public |
| Langues | anglais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 77,1 % | 19 février 2026 | ✅ Mesuré | |
| 2 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 74,6 % | 11 décembre 2025 | ✅ Mesuré |
| 3 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 72,6 % | 24 novembre 2025 | ✅ Mesuré |
| 4 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 71,6 % | 24 avril 2026 | ✅ Mesuré |
| 5 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 70,5 % | — | ✅ Mesuré |
| 6 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 67,8 % | 20 mai 2026 | ✅ Mesuré |
| 7 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 65,5 % | 24 avril 2026 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 71,6 %.
Notre analyse
Un score élevé traduit des performances solides et relativement homogènes dans l’ensemble des catégories, puisque le résultat correspond à une moyenne de scores normalisés sur 100. Il ne garantit toutefois pas une supériorité sur chaque tâche prise séparément. L’ajout régulier de questions récentes renforce la pertinence de l’évaluation et vise à réduire la contamination, sans faire de cette précaution une garantie absolue.
La rigueur de la comparaison doit aussi être nuancée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Le benchmark combine des évaluations automatiques et par juge, selon les tâches. Sa portée couvre plusieurs capacités générales, mais uniquement en anglais. Dans la base considérée, la médiane atteint 73 %, tandis que GPT-5.5 obtient le meilleur score à 80 %. Cet écart resserré indique un classement concentré dans sa partie supérieure et peut limiter la différenciation entre modèles performants, signe possible de saturation. Le classement révèle donc surtout leur niveau relatif sur l’agrégat LiveBench, plutôt qu’une mesure exhaustive de toutes leurs capacités.
Sources des scores : livebench.