Mystery Game Puzzles
Epoch: Mystery Game Puzzles est un benchmark textuel créé par Epoch AI pour évaluer la résolution d’énigmes inspirées des jeux de mystère. Chaque épreuve présente des informations et des indices à partir desquels le modèle doit produire une réponse finale.
Epoch: Mystery Game Puzzles est un benchmark textuel créé par Epoch AI pour évaluer la résolution d’énigmes inspirées des jeux de mystère. Chaque épreuve présente des informations et des indices à partir desquels le modèle doit produire une réponse finale.
Le benchmark mesure la capacité à combiner des indices textuels, à conduire des déductions logiques et à élaborer une solution cohérente. Il sert ainsi à comparer les modèles sur une tâche ciblée de raisonnement, où la qualité dépend de l’exploitation conjointe des éléments fournis.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Epoch AI |
| Capacités mesurées | Mesure la capacité à combiner des indices textuels, effectuer des déductions logiques et résoudre des énigmes de type jeu de mystère. |
| Modalité | Texte |
| Type de questions | puzzles textuels de raisonnement à réponse finale |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (21)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 🔒 Propriétaire | 59,0 % | 24 juillet 2026 | ✅ Mesuré |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 58,0 % | 9 juillet 2026 | ✅ Mesuré |
| 3 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 56,0 % | 23 avril 2026 | ✅ Mesuré |
| 4 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 52,0 % | 9 juin 2026 | ✅ Mesuré |
| 5 | Qwen3.8 Max | Qwen | 🔒 Propriétaire | 38,0 % | 2 août 2026 | ✅ Mesuré |
| 6 | GPT-5.4 | OpenAI | 🔒 Propriétaire | 37,0 % | 5 mars 2026 | ✅ Mesuré |
| 7 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 36,0 % | 28 mai 2026 | ✅ Mesuré |
| 8 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 35,0 % | 30 juin 2026 | ✅ Mesuré |
| 9 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 35,0 % | 9 juillet 2026 | ✅ Mesuré |
| 10 | Gemini 3.1 Pro Preview | ▫ n.d. | 34,0 % | 19 février 2026 | ✅ Mesuré | |
| 11 | Gemini 3.5 Flash | 🔒 Propriétaire | 32,0 % | 19 mai 2026 | ✅ Mesuré | |
| 12 | Qwen3.7 Max | Qwen | 🔒 Propriétaire | 32,0 % | 19 mai 2026 | ✅ Mesuré |
| 13 | Gemini 3.6 Flash | 🔒 Propriétaire | 30,0 % | 21 juillet 2026 | ✅ Mesuré | |
| 14 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 28,0 % | 16 avril 2026 | ✅ Mesuré |
| 15 | Kimi K3 | Moonshot AI | 🟢 Ouvert | 26,0 % | 16 juillet 2026 | ✅ Mesuré |
| 16 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 25,0 % | 5 février 2026 | ✅ Mesuré |
| 17 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 22,0 % | 24 novembre 2025 | ✅ Mesuré |
| 18 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 21,0 % | 5 août 2025 | ✅ Mesuré |
| 19 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 21,0 % | 9 juillet 2026 | ✅ Mesuré |
| 20 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 18,0 % | 20 avril 2026 | ✅ Mesuré |
| 21 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 17,0 % | 29 septembre 2025 | ✅ Mesuré |
Classement établi sur 21 modèles évalués, dont 19 de grands éditeurs. Score médian de l'ensemble : 32,0 %.
Notre analyse
Un score élevé indique qu’un modèle parvient fréquemment à relier les indices, à écarter les interprétations incompatibles et à déduire la réponse attendue. Les scores étant au moins partiellement mesurés par un tiers, leur fiabilité repose davantage sur une évaluation externe que sur de seules déclarations des fournisseurs. Le classement montre toutefois une difficulté persistante : parmi les 21 modèles évalués, le score médian atteint 32 %, tandis que Claude Opus 5 arrive en tête à 59 %. Ce niveau maximal suggère que le benchmark n’est pas saturé dans l’ensemble observé et qu’une marge de progression subsiste. Sa portée reste ciblée sur des puzzles textuels de jeux de mystère : les résultats renseignent donc le raisonnement appliqué à ce format, et non l’ensemble des capacités d’un modèle. Enfin, comme pour tout corpus d’énigmes textuelles, une exposition préalable aux puzzles pourrait favoriser certains résultats. Le classement met surtout en évidence l’avantage de Claude Opus 5 sur cette tâche précise, ainsi que l’écart général entre les performances courantes et la résolution systématique.
Sources des scores : epoch.