Data Analysis
LiveBench: Data Analysis est la catégorie de LiveBench consacrée à l’analyse de données. Créée en 2024 par l’équipe LiveBench, réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California, elle s’appuie sur des jeux de données récents.
LiveBench: Data Analysis est la catégorie de LiveBench consacrée à l’analyse de données. Créée en 2024 par l’équipe LiveBench, réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California, elle s’appuie sur des jeux de données récents.
Le benchmark mesure la capacité des modèles à manipuler et interpréter des tableaux, notamment par transformation, reformatage ou prédiction de colonnes. Il fournit ainsi un indicateur ciblé des performances sur des tâches d’analyse dont les réponses peuvent être vérifiées objectivement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Abacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench) |
| Capacités mesurées | Analyse de donnees : manipulation et interpretation de tableaux et jeux de donnees recents (ex. transformation, reformatage, predictions de colonnes) |
| Modalité | Texte |
| Type de questions | Taches de manipulation et d'interpretation de donnees (basees sur des jeux de donnees recents) |
| Métrique d'évaluation | Scoring automatique sur verite-terrain objective et verifiable, sans juge LLM |
| Accès | Public |
| Licence | Apache-2.0 (depot avec composants sous MIT) |
| Langues | anglais |
| Taille du jeu | 40-100 questions par tache (plusieurs taches par categorie) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 78,5 % | 19 février 2026 | ✅ Mesuré | |
| 2 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 78,2 % | 11 décembre 2025 | ✅ Mesuré |
| 3 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 74,5 % | 24 avril 2026 | ✅ Mesuré |
| 4 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 74,4 % | 24 novembre 2025 | ✅ Mesuré |
| 5 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 70,8 % | 20 mai 2026 | ✅ Mesuré |
| 6 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 68,0 % | 24 avril 2026 | ✅ Mesuré |
| 7 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 65,1 % | — | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 74,4 %.
Notre analyse
Un score élevé indique qu’un modèle produit fréquemment les résultats attendus lors d’opérations de manipulation et d’interprétation de données récentes. L’évaluation repose sur une vérité-terrain objective et un scoring automatique, sans juge LLM, ce qui renforce la reproductibilité de la notation. La fiabilité pratique du classement doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.
Avec une médiane de 73 % et un meilleur résultat de 82 % pour GPT-5.5, le classement montre un niveau global déjà élevé, mais pas de saturation complète au plafond. L’écart entre ces deux repères reste limité, ce qui peut réduire le pouvoir discriminant parmi les modèles les plus performants. Le recours à des jeux de données récents constitue un garde-fou face au risque de contamination, sans modifier la portée ciblée du benchmark. Les résultats concernent uniquement des tâches anglophones d’analyse de données et ne résument donc pas les capacités générales d’un modèle. Sur les 26 modèles suivis, GPT-5.5 occupe la première place dans cette catégorie.
Sources des scores : livebench.