ZebraLogic

ZebraLogic est un cadre d’évaluation conçu par Bill Yuchen Lin et ses coauteurs, dans le cadre de travaux associés à Allen Institute for AI et Google DeepMind. Il évalue le raisonnement logique des grands modèles de langage à partir de puzzles de grille générés depuis des problèmes de…

ZebraLogic est un cadre d’évaluation conçu par Bill Yuchen Lin et ses coauteurs, dans le cadre de travaux associés à Allen Institute for AI et Google DeepMind. Il évalue le raisonnement logique des grands modèles de langage à partir de puzzles de grille générés depuis des problèmes de satisfaction de contraintes.

Sa complexité peut être contrôlée et quantifiée, notamment par la taille de l’espace de recherche et le nombre de conflits Z3. ZebraLogic sert ainsi à observer la capacité des modèles à résoudre des contraintes combinatoires, mais aussi la dégradation de leurs performances lorsque la difficulté augmente.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBill Yuchen Lin et al. (travaux associés à Allen Institute for AI / Google DeepMind)
Capacités mesuréesRaisonnement logique des LLM via des puzzles de grille logique dérivés de CSP, à complexité contrôlable (taille d'espace de recherche, nombre de conflits Z3).
ModalitéTexte
Type de questionsRaisonnement logique (grilles logiques / problèmes de satisfaction de contraintes)
Métrique d'évaluationExactitude (taux de puzzles/cellules résolus)
AccèsPublic
LanguesAnglais
Taille du jeu1 000 puzzles de grille logique
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert97,3 %22 septembre 2025Auto-déclaré
2LongCat-Flash-ThinkingMeituan🟢 Ouvert95,5 %22 septembre 2025Auto-déclaré
3Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert95,0 %22 juillet 2025Auto-déclaré
4LongCat-Flash-ChatMeituan🟢 Ouvert89,3 %29 août 2025Auto-déclaré
5Kimi K2 InstructMoonshot AI🟢 Ouvert89,0 %11 juillet 2025Auto-déclaré
6Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert89,0 %5 septembre 2025Auto-déclaré
7MiniMax M1MiniMax🟢 Ouvert80,1 %17 juin 2025Auto-déclaré

Classement établi sur 7 modèles évalués. Score médian de l'ensemble : 89,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle résout correctement une forte proportion des puzzles ou de leurs cellules, selon le niveau d’exactitude retenu. Il traduit donc une bonne maîtrise des contraintes logiques dans ce cadre précis, sans constituer une mesure générale de toutes les formes de raisonnement. La complexité contrôlable renforce l’intérêt expérimental du benchmark, car elle permet de relier la baisse de précision à l’augmentation mesurable de la difficulté, phénomène décrit comme une « curse of complexity ».

Le classement montre des performances globalement élevées parmi les sept modèles recensés, avec une médiane de 89 % et Qwen3 VL 235B A22B Thinking en tête à 97 %. Cette proximité avec le maximum suggère un risque de saturation pour les meilleurs systèmes, même si les puzzles plus complexes continuent de révéler des écarts. L’interprétation doit aussi tenir compte du fait que les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’issus d’une mesure indépendante uniforme. L’accès public appelle également à considérer le risque de contamination lors de comparaisons futures. Enfin, la portée reste centrée sur des grilles logiques en anglais dérivées de CSP.


Sources des scores : llm-stats.