Graphwalks parents >128k

Graphwalks parents >128k est un benchmark de raisonnement sur des graphes créé par OpenAI en 2025. Il évalue la capacité des modèles de langage à exploiter un contexte dépassant 128 000 tokens pour retrouver les nœuds parents dans des graphes encodés sous forme de hash hexadécimaux.

Graphwalks parents >128k est un benchmark de raisonnement sur des graphes créé par OpenAI en 2025. Il évalue la capacité des modèles de langage à exploiter un contexte dépassant 128 000 tokens pour retrouver les nœuds parents dans des graphes encodés sous forme de hash hexadécimaux.

Les problèmes exigent un raisonnement multi-sauts et un parcours en largeur afin de générer l’ensemble attendu de nœuds. Le benchmark sert ainsi à mesurer conjointement la compréhension d’une structure de graphe, le suivi de relations et le raisonnement en contexte long.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesRaisonnement en contexte long sur structure de graphe, identification des nœuds parents, parcours en largeur (BFS) sur graphes encodés dans le contexte
ModalitéTexte
Type de questionsraisonnement multi-sauts sur graphe (génération de la liste des nœuds)
Métrique d'évaluationscore F1 (précision/rappel sur l'ensemble des nœuds)
AccèsPublic
LicenceMIT
Languesanglais (graphes encodés en hash hexadécimaux)
Taille du jeu~1150 problèmes au total (tâche "parents", contexte >128k)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.6Anthropic🔒 Propriétaire95,4 %5 février 2026Auto-déclaré
2Claude Opus 4.8Anthropic🔒 Propriétaire83,3 %28 mai 2026Auto-déclaré
3GPT-5.5OpenAI🔒 Propriétaire58,5 %23 avril 2026Auto-déclaré
4GPT-4.5OpenAI🔒 Propriétaire32,4 %5 mars 2026Auto-déclaré
5GPT-4.1OpenAI🔒 Propriétaire25,0 %14 avril 2025Auto-déclaré
6GPT-4.1 miniOpenAI🔒 Propriétaire11,0 %14 avril 2025Auto-déclaré
7GPT-4.1 nanoOpenAI🔒 Propriétaire5,6 %14 avril 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 32,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score F1 élevé indique que le modèle identifie les nœuds parents avec un bon équilibre entre précision et rappel. Claude Opus 4.6 atteint 95 %, tandis que le score médian des sept modèles évalués s’établit à 32 %. Cet écart révèle une forte disparité de capacités et suggère que la tâche reste difficile pour une part importante du classement. Le résultat du meilleur modèle approche toutefois le plafond de la métrique, ce qui peut réduire le pouvoir discriminant du benchmark entre les systèmes les plus performants.

La lecture du classement appelle aussi à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un cadre de mesure indépendant. L’accès public au jeu crée en outre un risque de contamination, notamment si ses problèmes ont été exposés pendant l’entraînement ou l’optimisation. Enfin, la portée reste ciblée : Graphwalks parents >128k mesure une tâche particulière de génération de nœuds parents sur des graphes en anglais, encodés dans de très longs contextes. Il ne constitue donc pas une mesure générale de toutes les formes de raisonnement.


Sources des scores : llm-stats.