Graphwalks BFS >128k
Graphwalks BFS >128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel sur des graphes dans des contextes dépassant 128k tokens. Il soumet les modèles à des graphes synthétiques composés d’arêtes orientées.
Graphwalks BFS >128k est un benchmark créé par OpenAI pour évaluer le raisonnement relationnel sur des graphes dans des contextes dépassant 128k tokens. Il soumet les modèles à des graphes synthétiques composés d’arêtes orientées.
Les tâches portent sur le parcours en largeur, ou BFS, ainsi que sur la recherche de nœuds parents. Le benchmark sert ainsi à mesurer la capacité d’un modèle à suivre des relations, maintenir une représentation cohérente du graphe et restituer l’ensemble de nœuds attendu malgré un contexte très long.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Raisonnement relationnel sur graphe (parcours BFS) en tres long contexte (au-dela de 128k tokens) |
| Modalité | Texte |
| Type de questions | Raisonnement sur graphe (BFS et recherche de noeuds parents) en long contexte |
| Métrique d'évaluation | F1 (precision/rappel sur l'ensemble de noeuds attendu) |
| Accès | Public |
| Licence | MIT |
| Langues | Anglais (graphes synthetiques d'aretes orientees) |
| Taille du jeu | 1 150 exemples au total (la variante >128k cible les contextes longs) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 90,7 % | 9 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 81,3 % | 9 juillet 2026 | Auto-déclaré |
| 3 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 80,0 % | — | Auto-déclaré |
| 4 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 76,9 % | 9 juillet 2026 | Auto-déclaré |
| 5 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 68,1 % | 28 mai 2026 | Auto-déclaré |
| 6 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 61,5 % | 5 février 2026 | Auto-déclaré |
| 7 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 45,4 % | 23 avril 2026 | Auto-déclaré |
| 8 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 21,4 % | 5 mars 2026 | Auto-déclaré |
| 9 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 19,0 % | 14 avril 2025 | Auto-déclaré |
| 10 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 15,0 % | 14 avril 2025 | Auto-déclaré |
| 11 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 2,9 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 11 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 61,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score F1 élevé indique que le modèle identifie avec justesse les nœuds attendus, en conciliant précision et rappel. Il reflète donc une exécution plus fiable des opérations de BFS et de recherche de parents sur des graphes placés dans de très longs contextes. La lecture du classement appelle toutefois à la prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un protocole de mesure indépendant. Parmi les huit modèles évalués dans la base, Claude Mythos Preview atteint 80 %, tandis que la médiane s’établit à 33 %. Cet écart révèle une forte différenciation des capacités sur cette tâche et ne suggère pas une saturation générale du benchmark. Sa portée reste spécialisée : il évalue le raisonnement sur des graphes synthétiques d’arêtes orientées, et non le raisonnement général. Son accès public implique aussi de considérer le risque de contamination lors de l’interprétation des scores, sans que cette possibilité établisse à elle seule qu’une contamination a eu lieu.
Sources des scores : llm-stats.