Language
LiveBench: Language est la catégorie consacrée à la compréhension du langage au sein de LiveBench, créé par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Publié en 2024, il mobilise notamment des articles et des…
LiveBench: Language est la catégorie consacrée à la compréhension du langage au sein de LiveBench, créé par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Publié en 2024, il mobilise notamment des articles et des synopsis récents.
Ses tâches évaluent la réorganisation de texte, la correction de fautes, la complétion de connexions et les déductions fondées sur des contenus récents. La notation automatique repose sur une vérité-terrain objective et vérifiable, afin de comparer les capacités linguistiques des modèles sans recourir à un juge LLM.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Abacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench) |
| Capacités mesurées | Comprehension du langage : ex. reorganisation de texte, correction de fautes, deductions a partir d'articles ou de synopsis recents |
| Modalité | Texte |
| Type de questions | Taches de comprehension du langage (ex. synopsis de films, articles recents, completion de connexions) |
| Métrique d'évaluation | Scoring automatique sur verite-terrain objective et verifiable, sans juge LLM |
| Accès | Public |
| Licence | Apache-2.0 (depot avec composants sous MIT) |
| Langues | anglais |
| Taille du jeu | 40-100 questions par tache (plusieurs taches par categorie) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 85,4 % | 19 février 2026 | ✅ Mesuré | |
| 2 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 81,3 % | 24 novembre 2025 | ✅ Mesuré |
| 3 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 79,8 % | 11 décembre 2025 | ✅ Mesuré |
| 4 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 78,1 % | 24 avril 2026 | ✅ Mesuré |
| 5 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 75,1 % | — | ✅ Mesuré |
| 6 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 72,5 % | 20 mai 2026 | ✅ Mesuré |
| 7 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 70,1 % | 24 avril 2026 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 78,1 %.
Notre analyse
Un score élevé indique une forte aptitude à résoudre les tâches de compréhension proposées, notamment restituer des connexions, corriger ou réorganiser du texte et déduire des informations à partir d’articles ou de synopsis. L’évaluation bénéficie d’un protocole automatique fondé sur des réponses vérifiables, ce qui limite la subjectivité d’un juge LLM. La lecture des résultats exige néanmoins de distinguer la méthode de notation de la provenance des scores, ceux de la base étant majoritairement auto-déclarés par les éditeurs.
Le classement place Claude Fable 5 en tête à 89 %, face à une médiane de 77 % parmi 26 modèles. Cet écart met en évidence une différenciation réelle, tout en montrant des performances globalement déjà élevées, susceptibles de réduire progressivement le pouvoir discriminant si les scores se rapprochent du plafond. Le recours à des sources récentes inscrit les tâches dans des contenus actuels, mais la contamination demeure un risque à surveiller lorsque ces contenus deviennent accessibles aux modèles. Enfin, la portée reste circonscrite à des tâches linguistiques en anglais, avec plusieurs tâches comportant chacune de 40 à 100 questions.
Sources des scores : livebench.