Language

LiveBench: Language est la catégorie consacrée à la compréhension du langage au sein de LiveBench, créé par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Publié en 2024, il mobilise notamment des articles et des…

LiveBench: Language est la catégorie consacrée à la compréhension du langage au sein de LiveBench, créé par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Publié en 2024, il mobilise notamment des articles et des synopsis récents.

Ses tâches évaluent la réorganisation de texte, la correction de fautes, la complétion de connexions et les déductions fondées sur des contenus récents. La notation automatique repose sur une vérité-terrain objective et vérifiable, afin de comparer les capacités linguistiques des modèles sans recourir à un juge LLM.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAbacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench)
Capacités mesuréesComprehension du langage : ex. reorganisation de texte, correction de fautes, deductions a partir d'articles ou de synopsis recents
ModalitéTexte
Type de questionsTaches de comprehension du langage (ex. synopsis de films, articles recents, completion de connexions)
Métrique d'évaluationScoring automatique sur verite-terrain objective et verifiable, sans juge LLM
AccèsPublic
LicenceApache-2.0 (depot avec composants sous MIT)
Languesanglais
Taille du jeu40-100 questions par tache (plusieurs taches par categorie)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.85,4 %19 février 2026✅ Mesuré
2Claude Opus 4.5Anthropic🔒 Propriétaire81,3 %24 novembre 2025✅ Mesuré
3GPT-5.2OpenAI🔒 Propriétaire79,8 %11 décembre 2025✅ Mesuré
4DeepSeek V4 ProDeepSeek▫ n.d.78,1 %24 avril 2026✅ Mesuré
5Kimi K2.6 ThinkingMoonshot AI▫ n.d.75,1 %✅ Mesuré
6xAI: Grok Build 0.1xAI▫ n.d.72,5 %20 mai 2026✅ Mesuré
7DeepSeek V4 FlashDeepSeek▫ n.d.70,1 %24 avril 2026✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 78,1 %.

Notre analyse

Un score élevé indique une forte aptitude à résoudre les tâches de compréhension proposées, notamment restituer des connexions, corriger ou réorganiser du texte et déduire des informations à partir d’articles ou de synopsis. L’évaluation bénéficie d’un protocole automatique fondé sur des réponses vérifiables, ce qui limite la subjectivité d’un juge LLM. La lecture des résultats exige néanmoins de distinguer la méthode de notation de la provenance des scores, ceux de la base étant majoritairement auto-déclarés par les éditeurs.

Le classement place Claude Fable 5 en tête à 89 %, face à une médiane de 77 % parmi 26 modèles. Cet écart met en évidence une différenciation réelle, tout en montrant des performances globalement déjà élevées, susceptibles de réduire progressivement le pouvoir discriminant si les scores se rapprochent du plafond. Le recours à des sources récentes inscrit les tâches dans des contenus actuels, mais la contamination demeure un risque à surveiller lorsque ces contenus deviennent accessibles aux modèles. Enfin, la portée reste circonscrite à des tâches linguistiques en anglais, avec plusieurs tâches comportant chacune de 40 à 100 questions.


Sources des scores : livebench.