Graphwalks BFS <128k

Graphwalks BFS <128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel et structurel sur des graphes dans des contextes longs. Les graphes, représentés par des hachages hexadécimaux, encodent notamment des relations parent-enfant à suivre à travers le contexte.

Graphwalks BFS <128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel et structurel sur des graphes dans des contextes longs. Les graphes, représentés par des hachages hexadécimaux, encodent notamment des relations parent-enfant à suivre à travers le contexte.

Les tâches demandent d’effectuer un parcours en largeur, puis de retourner les nœuds atteignables à une profondeur donnée. Le benchmark mesure ainsi la capacité des modèles à exploiter correctement une structure distribuée dans un contexte inférieur à 128k tokens, au moyen d’un score F1 combinant précision et rappel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesRaisonnement relationnel/structurel sur graphe en contexte long : suivi de relations parent-enfant à travers le contexte (<128k tokens)
ModalitéTexte
Type de questionsParcours en largeur (BFS) sur un graphe encodé en contexte long ; retourne les nœuds atteignables à une profondeur donnée
Métrique d'évaluationF1 (précision/rappel sur les ensembles de nœuds prédits vs attendus)
AccèsPublic
LicenceMIT
LanguesAnglais (graphes en hachages hexadécimaux)
Taille du jeu1 150 exemples au total (BFS + parents) ; cette entrée = sous-ensemble <128k tokens de contexte
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.2OpenAI🔒 Propriétaire94,0 %11 décembre 2025Auto-déclaré
2GPT-5OpenAI🔒 Propriétaire78,3 %7 août 2025Auto-déclaré
3GPT-5.4 miniOpenAI🔒 Propriétaire76,3 %17 mars 2026Auto-déclaré
4GPT-5.4 nanoOpenAI🔒 Propriétaire73,4 %17 mars 2026Auto-déclaré
5GPT-4.5OpenAI🔒 Propriétaire72,3 %5 mars 2026Auto-déclaré
6GPT-4.1OpenAI🔒 Propriétaire61,7 %14 avril 2025Auto-déclaré
7GPT-4.1 miniOpenAI🔒 Propriétaire61,7 %14 avril 2025Auto-déclaré
8o3-miniOpenAI🔒 Propriétaire51,0 %30 janvier 2025Auto-déclaré
9GPT-4oOpenAI🔒 Propriétaire41,7 %27 mars 2025Auto-déclaré
10GPT-4.1 nanoOpenAI🔒 Propriétaire25,0 %14 avril 2025Auto-déclaré

Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 67,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique que le modèle retrouve les ensembles de nœuds attendus avec peu d’omissions et peu d’ajouts erronés. Le meilleur résultat, 94 % pour GPT-5.2, contre une médiane de 68 %, montre une avance nette en tête du classement, tout en suggérant un possible début de saturation pour les modèles les plus performants. Cette lecture reste spécifique au parcours BFS et au suivi de relations parent-enfant dans des contextes inférieurs à 128k tokens. Elle ne doit pas être étendue à l’ensemble du raisonnement sur graphe ou du raisonnement en contexte long. La métrique F1 fournit une mesure structurée de la qualité des ensembles prédits, mais les scores sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité de leur vérification. Le caractère public du benchmark impose aussi de considérer un risque de contamination lors de l’interprétation des performances. Enfin, le classement ne permet pas une comparaison indépendante entre éditeurs : les dix modèles évalués sont tous édités par OpenAI, également créateur du benchmark. Il renseigne donc surtout sur les écarts internes à cette gamme de modèles.


Sources des scores : llm-stats.