Graphwalks parents <128k

Graphwalks parents <128k est un benchmark créé par OpenAI pour évaluer le raisonnement structurel sur des graphes encodés dans un contexte long. Les tâches demandent d’identifier les nœuds parents d’un nœud donné, à partir des relations d’arêtes représentées par des hachages hexadécimaux.

Graphwalks parents <128k est un benchmark créé par OpenAI pour évaluer le raisonnement structurel sur des graphes encodés dans un contexte long. Les tâches demandent d’identifier les nœuds parents d’un nœud donné, à partir des relations d’arêtes représentées par des hachages hexadécimaux.

Ce sous-ensemble se concentre sur les contextes inférieurs à 128k tokens. Il mesure la capacité des modèles à parcourir et interpréter correctement une structure relationnelle étendue, plutôt qu’à restituer une connaissance générale. La qualité des réponses est évaluée par le score F1.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesRaisonnement structurel sur graphe en contexte long : recherche des parents d'un nœud, compréhension des relations d'arêtes (<128k tokens)
ModalitéTexte
Type de questionsIdentification des nœuds parents (nœuds ayant une arête vers un nœud donné) sur un graphe encodé en contexte long
Métrique d'évaluationF1 (précision/rappel sur les ensembles de nœuds prédits vs attendus)
AccèsPublic
LicenceMIT
LanguesAnglais (graphes en hachages hexadécimaux)
Taille du jeu1 150 exemples au total (BFS + parents) ; cette entrée = sous-ensemble <128k tokens de contexte
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.2OpenAI🔒 Propriétaire89,0 %11 décembre 2025Auto-déclaré
2GPT-5OpenAI🔒 Propriétaire73,3 %7 août 2025Auto-déclaré
3GPT-4.5OpenAI🔒 Propriétaire72,6 %5 mars 2026Auto-déclaré
4GPT-5.4 miniOpenAI🔒 Propriétaire71,5 %17 mars 2026Auto-déclaré
5GPT-4.1 miniOpenAI🔒 Propriétaire60,5 %14 avril 2025Auto-déclaré
6o3-miniOpenAI🔒 Propriétaire58,3 %30 janvier 2025Auto-déclaré
7GPT-4.1OpenAI🔒 Propriétaire58,0 %14 avril 2025Auto-déclaré
8GPT-5.4 nanoOpenAI🔒 Propriétaire50,8 %17 mars 2026Auto-déclaré
9GPT-4oOpenAI🔒 Propriétaire35,4 %27 mars 2025Auto-déclaré
10GPT-4.1 nanoOpenAI🔒 Propriétaire9,4 %14 avril 2025Auto-déclaré

Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 59,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique que le modèle identifie avec exactitude les ensembles de nœuds ayant une arête vers la cible, en conciliant précision et rappel. Avec un meilleur score de 90 % pour GPT-5.4 et une médiane de 59 %, le classement fait apparaître des écarts substantiels entre les dix modèles évalués, sans saturation complète du benchmark.

La portée reste spécialisée : Graphwalks parents <128k teste une forme précise de raisonnement sur graphe, dans des contextes longs mais inférieurs à 128k tokens. Ses résultats ne résument donc pas les capacités générales d’un modèle. Le caractère public du jeu appelle aussi à considérer le risque méthodologique de contamination lors de l’interprétation des performances.

La rigueur comparative est limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Surtout, les dix modèles classés sont édités par OpenAI, également créateur du benchmark. Le classement renseigne ainsi sur les différences internes à cette gamme, mais ne constitue pas une source indépendante pour comparer les modèles OpenAI avec ceux d’autres éditeurs.


Sources des scores : llm-stats.