LiveBench 20241125

LiveBench 20241125 est un benchmark public conçu par Abacus.AI, NYU et NVIDIA, avec Colin White, Samuel Dooley et leurs coauteurs. Il vise à limiter la contamination des jeux de test grâce à des questions renouvelées mensuellement, issues de sources récemment publiées.

LiveBench 20241125 est un benchmark public conçu par Abacus.AI, NYU et NVIDIA, avec Colin White, Samuel Dooley et leurs coauteurs. Il vise à limiter la contamination des jeux de test grâce à des questions renouvelées mensuellement, issues de sources récemment publiées.

Il évalue les modèles sur des tâches en anglais couvrant les mathématiques, le code, le raisonnement, le langage, le suivi d’instructions et l’analyse de données. Ses réponses à vérité-terrain objective permettent une notation automatique, destinée à comparer les capacités des modèles sans recourir à un juge LLM.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAbacus.AI, NYU et NVIDIA (Colin White, Samuel Dooley et al.)
Capacités mesuréesÉvaluation contamination-limitée sur math, code, raisonnement, langage, suivi d'instructions et analyse de données, avec scores objectifs et automatiques.
ModalitéTexte
Type de questionsTâches variées à vérité-terrain objective (math, code, raisonnement, langage, suivi d'instructions, analyse de données)
Métrique d'évaluationExactitude automatique sur réponses vérifiables (sans juge LLM)
AccèsPublic
Languesanglais
Taille du jeu18 tâches sur 6 catégories ; questions renouvelées mensuellement (snapshot 2024-11-25)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (14)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert79,6 %22 septembre 2025Auto-déclaré
2Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert78,4 %25 juillet 2025Auto-déclaré
3Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert76,6 %10 septembre 2025Auto-déclaré
4Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert75,8 %10 septembre 2025Auto-déclaré
5Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert75,4 %22 juillet 2025Auto-déclaré
6Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,8 %22 septembre 2025Auto-déclaré
7Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert74,7 %22 septembre 2025Auto-déclaré
8Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,2 %22 septembre 2025Auto-déclaré
9Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert72,1 %22 septembre 2025Auto-déclaré
10Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,8 %22 septembre 2025Auto-déclaré
11Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert68,4 %22 septembre 2025Auto-déclaré
12Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert65,4 %22 septembre 2025Auto-déclaré
13Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert62,0 %22 septembre 2025Auto-déclaré
14Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,9 %22 septembre 2025Auto-déclaré

Classement établi sur 14 modèles évalués. Score médian de l'ensemble : 73,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle fournit fréquemment la réponse vérifiable attendue sur les différentes catégories de LiveBench. La notation automatique, fondée sur une vérité-terrain objective et sans juge LLM, apporte une méthode cohérente et reproductible. La fiabilité pratique doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment.

Le renouvellement mensuel des questions réduit le risque de contamination par rapport à un jeu de test figé, sans transformer l’évaluation en mesure universelle. Le snapshot du 25 novembre 2024 porte sur des tâches en anglais et sur six familles de capacités précises. Il mesure donc la réussite à ces exercices vérifiables, et non l’ensemble des usages possibles d’un modèle.

Le classement place Qwen3 VL 235B A22B Thinking en tête à 80 %, contre une médiane de 73 % parmi les modèles évalués dans la base. Cet écart relativement resserré suggère une concentration des résultats et un risque de saturation partielle, susceptible de réduire le pouvoir discriminant entre les meilleurs modèles sur ce snapshot.


Sources des scores : llm-stats.