Chess Puzzles

Epoch: Chess Puzzles est un benchmark conçu par Epoch AI pour évaluer le raisonnement spatial et la planification à travers des positions d’échecs. Chaque puzzle demande de sélectionner le meilleur coup, avec une solution unique validée par le moteur Stockfish.

Epoch: Chess Puzzles est un benchmark conçu par Epoch AI pour évaluer le raisonnement spatial et la planification à travers des positions d’échecs. Chaque puzzle demande de sélectionner le meilleur coup, avec une solution unique validée par le moteur Stockfish.

Généré programmatiquement, cet ensemble sert de test léger pour obtenir rapidement une estimation des capacités de raisonnement des modèles. Il contribue notamment à l’Epoch Capabilities Index, en apportant une mesure ciblée et indépendante du langage naturel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesRaisonnement spatial et planification via la résolution de puzzles d'échecs (choix du meilleur coup validé par Stockfish).
ModalitéTexte
Type de questionsSélection du meilleur coup à partir d'une position d'échecs
Métrique d'évaluationExactitude (% de meilleurs coups corrects)
AccèsPublic
LanguesN/A (positions d'échecs)
Taille du jeu100 puzzles
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (20)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire64,0 %9 juillet 2026✅ Mesuré
2OpenAI: GPT-5.4 ProOpenAI🔒 Propriétaire58,6 %5 mars 2026✅ Mesuré
3Gemini 3.1 Pro PreviewGoogle▫ n.d.55,0 %19 février 2026✅ Mesuré
4GPT-5.6 TerraOpenAI🔒 Propriétaire54,0 %9 juillet 2026✅ Mesuré
5GPT-5.2OpenAI🔒 Propriétaire49,0 %11 décembre 2025✅ Mesuré
6GPT-5.6 LunaOpenAI🔒 Propriétaire40,0 %9 juillet 2026✅ Mesuré
7GPT-5OpenAI🔒 Propriétaire37,0 %7 août 2025✅ Mesuré
8Grok 4.5xAI🔒 Propriétaire36,0 %16 juillet 2026✅ Mesuré
9GPT-5.1OpenAI🔒 Propriétaire32,0 %13 novembre 2025✅ Mesuré
10Grok 4.3 BetaxAI▫ n.d.25,0 %17 avril 2026✅ Mesuré
11Grok 4.20xAI▫ n.d.24,0 %31 mars 2026✅ Mesuré
12DeepSeek V4 ProDeepSeek▫ n.d.20,0 %24 avril 2026✅ Mesuré
13Kimi K2 Thinking TurboMoonshot AI▫ n.d.20,0 %6 novembre 2025✅ Mesuré
14Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.20,0 %25 février 2026✅ Mesuré
15Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.17,2 %27 avril 2026✅ Mesuré
16Qwen 3.5 PlusQwen▫ n.d.17,0 %16 février 2026✅ Mesuré
17Qwen 3.6 MaxQwen▫ n.d.17,0 %20 avril 2026✅ Mesuré
18Claude Opus 4.5Anthropic🔒 Propriétaire12,0 %24 novembre 2025✅ Mesuré
19Claude Sonnet 4.5Anthropic🔒 Propriétaire12,0 %29 septembre 2025✅ Mesuré
20Qwen3-Max-InstructQwen▫ n.d.4,0 %24 septembre 2025✅ Mesuré

Classement établi sur 20 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 24,5 %.

Notre analyse

Un score élevé indique qu’un modèle identifie fréquemment le meilleur coup dans des positions exigeant raisonnement spatial et planification. La validation des solutions par Stockfish et l’existence d’un meilleur coup unique renforcent la cohérence de la correction. Les résultats de la base sont au moins partiellement mesurés par un tiers, ce qui leur confère davantage de poids qu’une évaluation reposant uniquement sur des scores auto-déclarés.

La portée reste toutefois ciblée : ces puzzles évaluent la sélection d’un coup d’échecs, et non l’ensemble des formes de raisonnement. Avec 100 positions et un usage pensé comme test léger, le benchmark fournit surtout un signal rapide. Son accès public peut aussi accroître le risque d’exposition préalable des modèles aux contenus évalués. Le meilleur résultat, obtenu par GPT-5.5 Pro avec 64 %, reste nettement inférieur à un score parfait, ce qui ne suggère pas une saturation générale. L’écart avec la médiane de 22 % révèle par ailleurs une forte différenciation entre les 49 modèles évalués, les meilleurs systèmes réussissant bien davantage de positions sans pour autant résoudre systématiquement le jeu.


Sources des scores : epoch.