Graphwalks BFS >128k

Graphwalks BFS >128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel sur des graphes dans des contextes dépassant 128k tokens. Il soumet les modèles à des graphes synthétiques composés d’arêtes orientées.

Graphwalks BFS >128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel sur des graphes dans des contextes dépassant 128k tokens. Il soumet les modèles à des graphes synthétiques composés d’arêtes orientées.

Les tâches portent sur le parcours en largeur, ou BFS, ainsi que sur la recherche de nœuds parents. Le benchmark sert ainsi à mesurer la capacité d’un modèle à suivre des relations, maintenir une représentation cohérente du graphe et restituer l’ensemble de nœuds attendu malgré un contexte très long.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesRaisonnement relationnel sur graphe (parcours BFS) en tres long contexte (au-dela de 128k tokens)
ModalitéTexte
Type de questionsRaisonnement sur graphe (BFS et recherche de noeuds parents) en long contexte
Métrique d'évaluationF1 (precision/rappel sur l'ensemble de noeuds attendu)
AccèsPublic
LicenceMIT
LanguesAnglais (graphes synthetiques d'aretes orientees)
Taille du jeu1 150 exemples au total (la variante >128k cible les contextes longs)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire90,7 %9 juillet 2026Auto-déclaré
2GPT-5.6 LunaOpenAI🔒 Propriétaire81,3 %9 juillet 2026Auto-déclaré
3Claude Mythos PreviewAnthropic🔒 Propriétaire80,0 %Auto-déclaré
4GPT-5.6 TerraOpenAI🔒 Propriétaire76,9 %9 juillet 2026Auto-déclaré
5Claude Opus 4.8Anthropic🔒 Propriétaire68,1 %28 mai 2026Auto-déclaré
6Claude Opus 4.6Anthropic🔒 Propriétaire61,5 %5 février 2026Auto-déclaré
7GPT-5.5OpenAI🔒 Propriétaire45,4 %23 avril 2026Auto-déclaré
8GPT-4.5OpenAI🔒 Propriétaire21,4 %5 mars 2026Auto-déclaré
9GPT-4.1OpenAI🔒 Propriétaire19,0 %14 avril 2025Auto-déclaré
10GPT-4.1 miniOpenAI🔒 Propriétaire15,0 %14 avril 2025Auto-déclaré
11GPT-4.1 nanoOpenAI🔒 Propriétaire2,9 %14 avril 2025Auto-déclaré

Classement établi sur 11 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 61,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score F1 élevé indique que le modèle identifie avec justesse les nœuds attendus, en conciliant précision et rappel. Il reflète donc une exécution plus fiable des opérations de BFS et de recherche de parents sur des graphes placés dans de très longs contextes. La lecture du classement appelle toutefois à la prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un protocole de mesure indépendant. Parmi les huit modèles évalués dans la base, Claude Mythos Preview atteint 80 %, tandis que la médiane s’établit à 33 %. Cet écart révèle une forte différenciation des capacités sur cette tâche et ne suggère pas une saturation générale du benchmark. Sa portée reste spécialisée : il évalue le raisonnement sur des graphes synthétiques d’arêtes orientées, et non le raisonnement général. Son accès public implique aussi de considérer le risque de contamination lors de l’interprétation des scores, sans que cette possibilité établisse à elle seule qu’une contamination a eu lieu.


Sources des scores : llm-stats.