Reasoning
LiveBench: Reasoning est la catégorie consacrée au raisonnement au sein de LiveBench, un benchmark pour grands modèles de langage créé par l’équipe LiveBench, réunissant notamment Abacus.AI et NYU. Renouvelé chaque mois afin de limiter la contamination, il repose sur des énigmes en…
LiveBench: Reasoning est la catégorie consacrée au raisonnement au sein de LiveBench, un benchmark pour grands modèles de langage créé par l’équipe LiveBench, réunissant notamment Abacus.AI et NYU. Renouvelé chaque mois afin de limiter la contamination, il repose sur des énigmes en anglais associées à une vérité-terrain objective.
Ce sous-ensemble mesure principalement le raisonnement logique et déductif, notamment la capacité à progresser étape par étape dans des tâches comme web_of_lies_v2. Les réponses ouvertes sont corrigées automatiquement, ce qui permet de comparer les modèles selon leur exactitude.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Équipe LiveBench (Abacus.AI, NYU et al.) |
| Capacités mesurées | Raisonnement logique et déductif (énigmes de logique, déduction étape par étape). |
| Modalité | Texte |
| Type de questions | Énigmes de raisonnement/logique, réponses ouvertes à correction automatique objective |
| Métrique d'évaluation | Exactitude (score automatique sur vérité-terrain) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | Sous-ensemble « raisonnement » de LiveBench (taille variable, mise à jour mensuelle) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 84,0 % | 19 février 2026 | ✅ Mesuré | |
| 2 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 83,2 % | 11 décembre 2025 | ✅ Mesuré |
| 3 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 82,7 % | 24 avril 2026 | ✅ Mesuré |
| 4 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 80,1 % | 24 novembre 2025 | ✅ Mesuré |
| 5 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 79,4 % | — | ✅ Mesuré |
| 6 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 76,4 % | 20 mai 2026 | ✅ Mesuré |
| 7 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 70,6 % | 24 avril 2026 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 80,1 %.
Notre analyse
Un score élevé indique qu’un modèle résout correctement une forte proportion d’énigmes logiques et produit les réponses attendues par la correction automatique. L’emploi d’une vérité-terrain objective apporte une mesure reproductible de l’exactitude, mais la fiabilité pratique du classement doit être nuancée puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés de manière uniforme par une même entité indépendante.
Le renouvellement mensuel réduit le risque de contamination, sans élargir la portée du test au-delà de son domaine ciblé. LiveBench: Reasoning renseigne sur la déduction logique en anglais, et non sur l’ensemble des capacités d’un modèle. Le niveau médian de 82 % parmi les 26 modèles de la base, face aux 90 % de Claude Opus 4.8, suggère des performances déjà élevées et un écart limité au sommet. Cette concentration peut entraîner un effet de saturation, rendant les différences fines plus difficiles à interpréter. Le classement met néanmoins en évidence l’avantage du meilleur modèle sur cet ensemble précis de tâches objectives.
Sources des scores : livebench.