Data Analysis

LiveBench: Data Analysis est la catégorie de LiveBench consacrée à l’analyse de données. Créée en 2024 par l’équipe LiveBench, réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California, elle s’appuie sur des jeux de données récents.

LiveBench: Data Analysis est la catégorie de LiveBench consacrée à l’analyse de données. Créée en 2024 par l’équipe LiveBench, réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California, elle s’appuie sur des jeux de données récents.

Le benchmark mesure la capacité des modèles à manipuler et interpréter des tableaux, notamment par transformation, reformatage ou prédiction de colonnes. Il fournit ainsi un indicateur ciblé des performances sur des tâches d’analyse dont les réponses peuvent être vérifiées objectivement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAbacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench)
Capacités mesuréesAnalyse de donnees : manipulation et interpretation de tableaux et jeux de donnees recents (ex. transformation, reformatage, predictions de colonnes)
ModalitéTexte
Type de questionsTaches de manipulation et d'interpretation de donnees (basees sur des jeux de donnees recents)
Métrique d'évaluationScoring automatique sur verite-terrain objective et verifiable, sans juge LLM
AccèsPublic
LicenceApache-2.0 (depot avec composants sous MIT)
Languesanglais
Taille du jeu40-100 questions par tache (plusieurs taches par categorie)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.78,5 %19 février 2026✅ Mesuré
2GPT-5.2OpenAI🔒 Propriétaire78,2 %11 décembre 2025✅ Mesuré
3DeepSeek V4 ProDeepSeek▫ n.d.74,5 %24 avril 2026✅ Mesuré
4Claude Opus 4.5Anthropic🔒 Propriétaire74,4 %24 novembre 2025✅ Mesuré
5xAI: Grok Build 0.1xAI▫ n.d.70,8 %20 mai 2026✅ Mesuré
6DeepSeek V4 FlashDeepSeek▫ n.d.68,0 %24 avril 2026✅ Mesuré
7Kimi K2.6 ThinkingMoonshot AI▫ n.d.65,1 %✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 74,4 %.

Notre analyse

Un score élevé indique qu’un modèle produit fréquemment les résultats attendus lors d’opérations de manipulation et d’interprétation de données récentes. L’évaluation repose sur une vérité-terrain objective et un scoring automatique, sans juge LLM, ce qui renforce la reproductibilité de la notation. La fiabilité pratique du classement doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.

Avec une médiane de 73 % et un meilleur résultat de 82 % pour GPT-5.5, le classement montre un niveau global déjà élevé, mais pas de saturation complète au plafond. L’écart entre ces deux repères reste limité, ce qui peut réduire le pouvoir discriminant parmi les modèles les plus performants. Le recours à des jeux de données récents constitue un garde-fou face au risque de contamination, sans modifier la portée ciblée du benchmark. Les résultats concernent uniquement des tâches anglophones d’analyse de données et ne résument donc pas les capacités générales d’un modèle. Sur les 26 modèles suivis, GPT-5.5 occupe la première place dans cette catégorie.


Sources des scores : livebench.