Graphwalks BFS <128k
Graphwalks BFS <128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel et structurel sur des graphes dans des contextes longs. Les graphes, représentés par des hachages hexadécimaux, encodent notamment des relations parent-enfant à suivre à travers le contexte.
Graphwalks BFS <128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel et structurel sur des graphes dans des contextes longs. Les graphes, représentés par des hachages hexadécimaux, encodent notamment des relations parent-enfant à suivre à travers le contexte.
Les tâches demandent d’effectuer un parcours en largeur, puis de retourner les nœuds atteignables à une profondeur donnée. Le benchmark mesure ainsi la capacité des modèles à exploiter correctement une structure distribuée dans un contexte inférieur à 128k tokens, au moyen d’un score F1 combinant précision et rappel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Raisonnement relationnel/structurel sur graphe en contexte long : suivi de relations parent-enfant à travers le contexte (<128k tokens) |
| Modalité | Texte |
| Type de questions | Parcours en largeur (BFS) sur un graphe encodé en contexte long ; retourne les nœuds atteignables à une profondeur donnée |
| Métrique d'évaluation | F1 (précision/rappel sur les ensembles de nœuds prédits vs attendus) |
| Accès | Public |
| Licence | MIT |
| Langues | Anglais (graphes en hachages hexadécimaux) |
| Taille du jeu | 1 150 exemples au total (BFS + parents) ; cette entrée = sous-ensemble <128k tokens de contexte |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 94,0 % | 11 décembre 2025 | Auto-déclaré |
| 2 | GPT-5 | OpenAI | 🔒 Propriétaire | 78,3 % | 7 août 2025 | Auto-déclaré |
| 3 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 76,3 % | 17 mars 2026 | Auto-déclaré |
| 4 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 73,4 % | 17 mars 2026 | Auto-déclaré |
| 5 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 72,3 % | 5 mars 2026 | Auto-déclaré |
| 6 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 61,7 % | 14 avril 2025 | Auto-déclaré |
| 7 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 61,7 % | 14 avril 2025 | Auto-déclaré |
| 8 | o3-mini | OpenAI | 🔒 Propriétaire | 51,0 % | 30 janvier 2025 | Auto-déclaré |
| 9 | GPT-4o | OpenAI | 🔒 Propriétaire | 41,7 % | 27 mars 2025 | Auto-déclaré |
| 10 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 25,0 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 67,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique que le modèle retrouve les ensembles de nœuds attendus avec peu d’omissions et peu d’ajouts erronés. Le meilleur résultat, 94 % pour GPT-5.2, contre une médiane de 68 %, montre une avance nette en tête du classement, tout en suggérant un possible début de saturation pour les modèles les plus performants. Cette lecture reste spécifique au parcours BFS et au suivi de relations parent-enfant dans des contextes inférieurs à 128k tokens. Elle ne doit pas être étendue à l’ensemble du raisonnement sur graphe ou du raisonnement en contexte long. La métrique F1 fournit une mesure structurée de la qualité des ensembles prédits, mais les scores sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité de leur vérification. Le caractère public du benchmark impose aussi de considérer un risque de contamination lors de l’interprétation des performances. Enfin, le classement ne permet pas une comparaison indépendante entre éditeurs : les dix modèles évalués sont tous édités par OpenAI, également créateur du benchmark. Il renseigne donc surtout sur les écarts internes à cette gamme de modèles.
Sources des scores : llm-stats.