LiveBench 20241125
LiveBench 20241125 est un benchmark public conçu par Abacus.AI, NYU et NVIDIA, avec Colin White, Samuel Dooley et leurs coauteurs. Il vise à limiter la contamination des jeux de test grâce à des questions renouvelées mensuellement, issues de sources récemment publiées.
LiveBench 20241125 est un benchmark public conçu par Abacus.AI, NYU et NVIDIA, avec Colin White, Samuel Dooley et leurs coauteurs. Il vise à limiter la contamination des jeux de test grâce à des questions renouvelées mensuellement, issues de sources récemment publiées.
Il évalue les modèles sur des tâches en anglais couvrant les mathématiques, le code, le raisonnement, le langage, le suivi d’instructions et l’analyse de données. Ses réponses à vérité-terrain objective permettent une notation automatique, destinée à comparer les capacités des modèles sans recourir à un juge LLM.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Abacus.AI, NYU et NVIDIA (Colin White, Samuel Dooley et al.) |
| Capacités mesurées | Évaluation contamination-limitée sur math, code, raisonnement, langage, suivi d'instructions et analyse de données, avec scores objectifs et automatiques. |
| Modalité | Texte |
| Type de questions | Tâches variées à vérité-terrain objective (math, code, raisonnement, langage, suivi d'instructions, analyse de données) |
| Métrique d'évaluation | Exactitude automatique sur réponses vérifiables (sans juge LLM) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 18 tâches sur 6 catégories ; questions renouvelées mensuellement (snapshot 2024-11-25) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (14)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,6 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,4 % | 25 juillet 2025 | Auto-déclaré |
| 3 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,6 % | 10 septembre 2025 | Auto-déclaré |
| 4 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,8 % | 10 septembre 2025 | Auto-déclaré |
| 5 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,4 % | 22 juillet 2025 | Auto-déclaré |
| 6 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,8 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,7 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,2 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,1 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,8 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,4 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,4 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,0 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,9 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 14 modèles évalués. Score médian de l'ensemble : 73,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle fournit fréquemment la réponse vérifiable attendue sur les différentes catégories de LiveBench. La notation automatique, fondée sur une vérité-terrain objective et sans juge LLM, apporte une méthode cohérente et reproductible. La fiabilité pratique doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment.
Le renouvellement mensuel des questions réduit le risque de contamination par rapport à un jeu de test figé, sans transformer l’évaluation en mesure universelle. Le snapshot du 25 novembre 2024 porte sur des tâches en anglais et sur six familles de capacités précises. Il mesure donc la réussite à ces exercices vérifiables, et non l’ensemble des usages possibles d’un modèle.
Le classement place Qwen3 VL 235B A22B Thinking en tête à 80 %, contre une médiane de 73 % parmi les modèles évalués dans la base. Cet écart relativement resserré suggère une concentration des résultats et un risque de saturation partielle, susceptible de réduire le pouvoir discriminant entre les meilleurs modèles sur ce snapshot.
Sources des scores : llm-stats.