Chess Puzzles
Epoch: Chess Puzzles est un benchmark conçu par Epoch AI pour évaluer le raisonnement spatial et la planification à travers des positions d’échecs. Chaque puzzle demande de sélectionner le meilleur coup, avec une solution unique validée par le moteur Stockfish.
Epoch: Chess Puzzles est un benchmark conçu par Epoch AI pour évaluer le raisonnement spatial et la planification à travers des positions d’échecs. Chaque puzzle demande de sélectionner le meilleur coup, avec une solution unique validée par le moteur Stockfish.
Généré programmatiquement, cet ensemble sert de test léger pour obtenir rapidement une estimation des capacités de raisonnement des modèles. Il contribue notamment à l’Epoch Capabilities Index, en apportant une mesure ciblée et indépendante du langage naturel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Raisonnement spatial et planification via la résolution de puzzles d'échecs (choix du meilleur coup validé par Stockfish). |
| Modalité | Texte |
| Type de questions | Sélection du meilleur coup à partir d'une position d'échecs |
| Métrique d'évaluation | Exactitude (% de meilleurs coups corrects) |
| Accès | Public |
| Langues | N/A (positions d'échecs) |
| Taille du jeu | 100 puzzles |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (20)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 64,0 % | 9 juillet 2026 | ✅ Mesuré |
| 2 | OpenAI: GPT-5.4 Pro | OpenAI | 🔒 Propriétaire | 58,6 % | 5 mars 2026 | ✅ Mesuré |
| 3 | Gemini 3.1 Pro Preview | ▫ n.d. | 55,0 % | 19 février 2026 | ✅ Mesuré | |
| 4 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 54,0 % | 9 juillet 2026 | ✅ Mesuré |
| 5 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 49,0 % | 11 décembre 2025 | ✅ Mesuré |
| 6 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 40,0 % | 9 juillet 2026 | ✅ Mesuré |
| 7 | GPT-5 | OpenAI | 🔒 Propriétaire | 37,0 % | 7 août 2025 | ✅ Mesuré |
| 8 | Grok 4.5 | xAI | 🔒 Propriétaire | 36,0 % | 16 juillet 2026 | ✅ Mesuré |
| 9 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 32,0 % | 13 novembre 2025 | ✅ Mesuré |
| 10 | Grok 4.3 Beta | xAI | ▫ n.d. | 25,0 % | 17 avril 2026 | ✅ Mesuré |
| 11 | Grok 4.20 | xAI | ▫ n.d. | 24,0 % | 31 mars 2026 | ✅ Mesuré |
| 12 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 20,0 % | 24 avril 2026 | ✅ Mesuré |
| 13 | Kimi K2 Thinking Turbo | Moonshot AI | ▫ n.d. | 20,0 % | 6 novembre 2025 | ✅ Mesuré |
| 14 | Qwen: Qwen3.5-Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 20,0 % | 25 février 2026 | ✅ Mesuré |
| 15 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 17,2 % | 27 avril 2026 | ✅ Mesuré |
| 16 | Qwen 3.5 Plus | Qwen | ▫ n.d. | 17,0 % | 16 février 2026 | ✅ Mesuré |
| 17 | Qwen 3.6 Max | Qwen | ▫ n.d. | 17,0 % | 20 avril 2026 | ✅ Mesuré |
| 18 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 12,0 % | 24 novembre 2025 | ✅ Mesuré |
| 19 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 12,0 % | 29 septembre 2025 | ✅ Mesuré |
| 20 | Qwen3-Max-Instruct | Qwen | ▫ n.d. | 4,0 % | 24 septembre 2025 | ✅ Mesuré |
Classement établi sur 20 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 24,5 %.
Notre analyse
Un score élevé indique qu’un modèle identifie fréquemment le meilleur coup dans des positions exigeant raisonnement spatial et planification. La validation des solutions par Stockfish et l’existence d’un meilleur coup unique renforcent la cohérence de la correction. Les résultats de la base sont au moins partiellement mesurés par un tiers, ce qui leur confère davantage de poids qu’une évaluation reposant uniquement sur des scores auto-déclarés.
La portée reste toutefois ciblée : ces puzzles évaluent la sélection d’un coup d’échecs, et non l’ensemble des formes de raisonnement. Avec 100 positions et un usage pensé comme test léger, le benchmark fournit surtout un signal rapide. Son accès public peut aussi accroître le risque d’exposition préalable des modèles aux contenus évalués. Le meilleur résultat, obtenu par GPT-5.5 Pro avec 64 %, reste nettement inférieur à un score parfait, ce qui ne suggère pas une saturation générale. L’écart avec la médiane de 22 % révèle par ailleurs une forte différenciation entre les 49 modèles évalués, les meilleurs systèmes réussissant bien davantage de positions sans pour autant résoudre systématiquement le jeu.
Sources des scores : epoch.