Graphwalks parents >128k
Graphwalks parents >128k est un benchmark de raisonnement sur des graphes créé par OpenAI en 2025. Il évalue la capacité des modèles de langage à exploiter un contexte dépassant 128 000 tokens pour retrouver les nœuds parents dans des graphes encodés sous forme de hash hexadécimaux.
Graphwalks parents >128k est un benchmark de raisonnement sur des graphes créé par OpenAI en 2025. Il évalue la capacité des modèles de langage à exploiter un contexte dépassant 128 000 tokens pour retrouver les nœuds parents dans des graphes encodés sous forme de hash hexadécimaux.
Les problèmes exigent un raisonnement multi-sauts et un parcours en largeur afin de générer l’ensemble attendu de nœuds. Le benchmark sert ainsi à mesurer conjointement la compréhension d’une structure de graphe, le suivi de relations et le raisonnement en contexte long.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Raisonnement en contexte long sur structure de graphe, identification des nœuds parents, parcours en largeur (BFS) sur graphes encodés dans le contexte |
| Modalité | Texte |
| Type de questions | raisonnement multi-sauts sur graphe (génération de la liste des nœuds) |
| Métrique d'évaluation | score F1 (précision/rappel sur l'ensemble des nœuds) |
| Accès | Public |
| Licence | MIT |
| Langues | anglais (graphes encodés en hash hexadécimaux) |
| Taille du jeu | ~1150 problèmes au total (tâche "parents", contexte >128k) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 95,4 % | 5 février 2026 | Auto-déclaré |
| 2 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 83,3 % | 28 mai 2026 | Auto-déclaré |
| 3 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 58,5 % | 23 avril 2026 | Auto-déclaré |
| 4 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 32,4 % | 5 mars 2026 | Auto-déclaré |
| 5 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 25,0 % | 14 avril 2025 | Auto-déclaré |
| 6 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 11,0 % | 14 avril 2025 | Auto-déclaré |
| 7 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 5,6 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 32,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score F1 élevé indique que le modèle identifie les nœuds parents avec un bon équilibre entre précision et rappel. Claude Opus 4.6 atteint 95 %, tandis que le score médian des sept modèles évalués s’établit à 32 %. Cet écart révèle une forte disparité de capacités et suggère que la tâche reste difficile pour une part importante du classement. Le résultat du meilleur modèle approche toutefois le plafond de la métrique, ce qui peut réduire le pouvoir discriminant du benchmark entre les systèmes les plus performants.
La lecture du classement appelle aussi à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un cadre de mesure indépendant. L’accès public au jeu crée en outre un risque de contamination, notamment si ses problèmes ont été exposés pendant l’entraînement ou l’optimisation. Enfin, la portée reste ciblée : Graphwalks parents >128k mesure une tâche particulière de génération de nœuds parents sur des graphes en anglais, encodés dans de très longs contextes. Il ne constitue donc pas une mesure générale de toutes les formes de raisonnement.
Sources des scores : llm-stats.