Reasoning

LiveBench: Reasoning est la catégorie consacrée au raisonnement au sein de LiveBench, un benchmark pour grands modèles de langage créé par l’équipe LiveBench, réunissant notamment Abacus.AI et NYU. Renouvelé chaque mois afin de limiter la contamination, il repose sur des énigmes en…

LiveBench: Reasoning est la catégorie consacrée au raisonnement au sein de LiveBench, un benchmark pour grands modèles de langage créé par l’équipe LiveBench, réunissant notamment Abacus.AI et NYU. Renouvelé chaque mois afin de limiter la contamination, il repose sur des énigmes en anglais associées à une vérité-terrain objective.

Ce sous-ensemble mesure principalement le raisonnement logique et déductif, notamment la capacité à progresser étape par étape dans des tâches comme web_of_lies_v2. Les réponses ouvertes sont corrigées automatiquement, ce qui permet de comparer les modèles selon leur exactitude.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkÉquipe LiveBench (Abacus.AI, NYU et al.)
Capacités mesuréesRaisonnement logique et déductif (énigmes de logique, déduction étape par étape).
ModalitéTexte
Type de questionsÉnigmes de raisonnement/logique, réponses ouvertes à correction automatique objective
Métrique d'évaluationExactitude (score automatique sur vérité-terrain)
AccèsPublic
LanguesAnglais
Taille du jeuSous-ensemble « raisonnement » de LiveBench (taille variable, mise à jour mensuelle)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.84,0 %19 février 2026✅ Mesuré
2GPT-5.2OpenAI🔒 Propriétaire83,2 %11 décembre 2025✅ Mesuré
3DeepSeek V4 ProDeepSeek▫ n.d.82,7 %24 avril 2026✅ Mesuré
4Claude Opus 4.5Anthropic🔒 Propriétaire80,1 %24 novembre 2025✅ Mesuré
5Kimi K2.6 ThinkingMoonshot AI▫ n.d.79,4 %✅ Mesuré
6xAI: Grok Build 0.1xAI▫ n.d.76,4 %20 mai 2026✅ Mesuré
7DeepSeek V4 FlashDeepSeek▫ n.d.70,6 %24 avril 2026✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 80,1 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une forte proportion d’énigmes logiques et produit les réponses attendues par la correction automatique. L’emploi d’une vérité-terrain objective apporte une mesure reproductible de l’exactitude, mais la fiabilité pratique du classement doit être nuancée puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés de manière uniforme par une même entité indépendante.

Le renouvellement mensuel réduit le risque de contamination, sans élargir la portée du test au-delà de son domaine ciblé. LiveBench: Reasoning renseigne sur la déduction logique en anglais, et non sur l’ensemble des capacités d’un modèle. Le niveau médian de 82 % parmi les 26 modèles de la base, face aux 90 % de Claude Opus 4.8, suggère des performances déjà élevées et un écart limité au sommet. Cette concentration peut entraîner un effet de saturation, rendant les différences fines plus difficiles à interpréter. Le classement met néanmoins en évidence l’avantage du meilleur modèle sur cet ensemble précis de tâches objectives.


Sources des scores : livebench.