ZebraLogic
ZebraLogic est un cadre d’évaluation conçu par Bill Yuchen Lin et ses coauteurs, dans le cadre de travaux associés à Allen Institute for AI et Google DeepMind. Il évalue le raisonnement logique des grands modèles de langage à partir de puzzles de grille générés depuis des problèmes de…
ZebraLogic est un cadre d’évaluation conçu par Bill Yuchen Lin et ses coauteurs, dans le cadre de travaux associés à Allen Institute for AI et Google DeepMind. Il évalue le raisonnement logique des grands modèles de langage à partir de puzzles de grille générés depuis des problèmes de satisfaction de contraintes.
Sa complexité peut être contrôlée et quantifiée, notamment par la taille de l’espace de recherche et le nombre de conflits Z3. ZebraLogic sert ainsi à observer la capacité des modèles à résoudre des contraintes combinatoires, mais aussi la dégradation de leurs performances lorsque la difficulté augmente.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Bill Yuchen Lin et al. (travaux associés à Allen Institute for AI / Google DeepMind) |
| Capacités mesurées | Raisonnement logique des LLM via des puzzles de grille logique dérivés de CSP, à complexité contrôlable (taille d'espace de recherche, nombre de conflits Z3). |
| Modalité | Texte |
| Type de questions | Raisonnement logique (grilles logiques / problèmes de satisfaction de contraintes) |
| Métrique d'évaluation | Exactitude (taux de puzzles/cellules résolus) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 1 000 puzzles de grille logique |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 97,3 % | 22 septembre 2025 | Auto-déclaré |
| 2 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 95,5 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,0 % | 22 juillet 2025 | Auto-déclaré |
| 4 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 89,3 % | 29 août 2025 | Auto-déclaré |
| 5 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 89,0 % | 11 juillet 2025 | Auto-déclaré |
| 6 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 89,0 % | 5 septembre 2025 | Auto-déclaré |
| 7 | MiniMax M1 | MiniMax | 🟢 Ouvert | 80,1 % | 17 juin 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués. Score médian de l'ensemble : 89,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle résout correctement une forte proportion des puzzles ou de leurs cellules, selon le niveau d’exactitude retenu. Il traduit donc une bonne maîtrise des contraintes logiques dans ce cadre précis, sans constituer une mesure générale de toutes les formes de raisonnement. La complexité contrôlable renforce l’intérêt expérimental du benchmark, car elle permet de relier la baisse de précision à l’augmentation mesurable de la difficulté, phénomène décrit comme une « curse of complexity ».
Le classement montre des performances globalement élevées parmi les sept modèles recensés, avec une médiane de 89 % et Qwen3 VL 235B A22B Thinking en tête à 97 %. Cette proximité avec le maximum suggère un risque de saturation pour les meilleurs systèmes, même si les puzzles plus complexes continuent de révéler des écarts. L’interprétation doit aussi tenir compte du fait que les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’issus d’une mesure indépendante uniforme. L’accès public appelle également à considérer le risque de contamination lors de comparaisons futures. Enfin, la portée reste centrée sur des grilles logiques en anglais dérivées de CSP.
Sources des scores : llm-stats.