Mystery Game Puzzles

Epoch: Mystery Game Puzzles est un benchmark textuel créé par Epoch AI pour évaluer la résolution d’énigmes inspirées des jeux de mystère. Chaque épreuve présente des informations et des indices à partir desquels le modèle doit produire une réponse finale.

Epoch: Mystery Game Puzzles est un benchmark textuel créé par Epoch AI pour évaluer la résolution d’énigmes inspirées des jeux de mystère. Chaque épreuve présente des informations et des indices à partir desquels le modèle doit produire une réponse finale.

Le benchmark mesure la capacité à combiner des indices textuels, à conduire des déductions logiques et à élaborer une solution cohérente. Il sert ainsi à comparer les modèles sur une tâche ciblée de raisonnement, où la qualité dépend de l’exploitation conjointe des éléments fournis.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEpoch AI
Capacités mesuréesMesure la capacité à combiner des indices textuels, effectuer des déductions logiques et résoudre des énigmes de type jeu de mystère.
ModalitéTexte
Type de questionspuzzles textuels de raisonnement à réponse finale

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (21)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 5Anthropic🔒 Propriétaire59,0 %24 juillet 2026✅ Mesuré
2GPT-5.6 SolOpenAI🔒 Propriétaire58,0 %9 juillet 2026✅ Mesuré
3GPT-5.5OpenAI🔒 Propriétaire56,0 %23 avril 2026✅ Mesuré
4Claude Fable 5Anthropic🔒 Propriétaire52,0 %9 juin 2026✅ Mesuré
5Qwen3.8 MaxQwen🔒 Propriétaire38,0 %2 août 2026✅ Mesuré
6GPT-5.4OpenAI🔒 Propriétaire37,0 %5 mars 2026✅ Mesuré
7Claude Opus 4.8Anthropic🔒 Propriétaire36,0 %28 mai 2026✅ Mesuré
8Claude Sonnet 5Anthropic🔒 Propriétaire35,0 %30 juin 2026✅ Mesuré
9GPT-5.6 TerraOpenAI🔒 Propriétaire35,0 %9 juillet 2026✅ Mesuré
10Gemini 3.1 Pro PreviewGoogle▫ n.d.34,0 %19 février 2026✅ Mesuré
11Gemini 3.5 FlashGoogle🔒 Propriétaire32,0 %19 mai 2026✅ Mesuré
12Qwen3.7 MaxQwen🔒 Propriétaire32,0 %19 mai 2026✅ Mesuré
13Gemini 3.6 FlashGoogle🔒 Propriétaire30,0 %21 juillet 2026✅ Mesuré
14Claude Opus 4.7Anthropic🔒 Propriétaire28,0 %16 avril 2026✅ Mesuré
15Kimi K3Moonshot AI🟢 Ouvert26,0 %16 juillet 2026✅ Mesuré
16Claude Opus 4.6Anthropic🔒 Propriétaire25,0 %5 février 2026✅ Mesuré
17Claude Opus 4.5Anthropic🔒 Propriétaire22,0 %24 novembre 2025✅ Mesuré
18Claude Opus 4.1Anthropic🔒 Propriétaire21,0 %5 août 2025✅ Mesuré
19GPT-5.6 LunaOpenAI🔒 Propriétaire21,0 %9 juillet 2026✅ Mesuré
20Kimi K2.6Moonshot AI🟢 Ouvert18,0 %20 avril 2026✅ Mesuré
21Claude Sonnet 4.5Anthropic🔒 Propriétaire17,0 %29 septembre 2025✅ Mesuré

Classement établi sur 21 modèles évalués, dont 19 de grands éditeurs. Score médian de l'ensemble : 32,0 %.

Notre analyse

Un score élevé indique qu’un modèle parvient fréquemment à relier les indices, à écarter les interprétations incompatibles et à déduire la réponse attendue. Les scores étant au moins partiellement mesurés par un tiers, leur fiabilité repose davantage sur une évaluation externe que sur de seules déclarations des fournisseurs. Le classement montre toutefois une difficulté persistante : parmi les 21 modèles évalués, le score médian atteint 32 %, tandis que Claude Opus 5 arrive en tête à 59 %. Ce niveau maximal suggère que le benchmark n’est pas saturé dans l’ensemble observé et qu’une marge de progression subsiste. Sa portée reste ciblée sur des puzzles textuels de jeux de mystère : les résultats renseignent donc le raisonnement appliqué à ce format, et non l’ensemble des capacités d’un modèle. Enfin, comme pour tout corpus d’énigmes textuelles, une exposition préalable aux puzzles pourrait favoriser certains résultats. Le classement met surtout en évidence l’avantage de Claude Opus 5 sur cette tâche précise, ainsi que l’écart général entre les performances courantes et la résolution systématique.


Sources des scores : epoch.