Graphwalks parents <128k
Graphwalks parents <128k est un benchmark créé par OpenAI pour évaluer le raisonnement structurel sur des graphes encodés dans un contexte long. Les tâches demandent d’identifier les nœuds parents d’un nœud donné, à partir des relations d’arêtes représentées par des hachages hexadécimaux.
Graphwalks parents <128k est un benchmark créé par OpenAI pour évaluer le raisonnement structurel sur des graphes encodés dans un contexte long. Les tâches demandent d’identifier les nœuds parents d’un nœud donné, à partir des relations d’arêtes représentées par des hachages hexadécimaux.
Ce sous-ensemble se concentre sur les contextes inférieurs à 128k tokens. Il mesure la capacité des modèles à parcourir et interpréter correctement une structure relationnelle étendue, plutôt qu’à restituer une connaissance générale. La qualité des réponses est évaluée par le score F1.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Raisonnement structurel sur graphe en contexte long : recherche des parents d'un nœud, compréhension des relations d'arêtes (<128k tokens) |
| Modalité | Texte |
| Type de questions | Identification des nœuds parents (nœuds ayant une arête vers un nœud donné) sur un graphe encodé en contexte long |
| Métrique d'évaluation | F1 (précision/rappel sur les ensembles de nœuds prédits vs attendus) |
| Accès | Public |
| Licence | MIT |
| Langues | Anglais (graphes en hachages hexadécimaux) |
| Taille du jeu | 1 150 exemples au total (BFS + parents) ; cette entrée = sous-ensemble <128k tokens de contexte |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 89,0 % | 11 décembre 2025 | Auto-déclaré |
| 2 | GPT-5 | OpenAI | 🔒 Propriétaire | 73,3 % | 7 août 2025 | Auto-déclaré |
| 3 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 72,6 % | 5 mars 2026 | Auto-déclaré |
| 4 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 71,5 % | 17 mars 2026 | Auto-déclaré |
| 5 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 60,5 % | 14 avril 2025 | Auto-déclaré |
| 6 | o3-mini | OpenAI | 🔒 Propriétaire | 58,3 % | 30 janvier 2025 | Auto-déclaré |
| 7 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 58,0 % | 14 avril 2025 | Auto-déclaré |
| 8 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 50,8 % | 17 mars 2026 | Auto-déclaré |
| 9 | GPT-4o | OpenAI | 🔒 Propriétaire | 35,4 % | 27 mars 2025 | Auto-déclaré |
| 10 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 9,4 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 59,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique que le modèle identifie avec exactitude les ensembles de nœuds ayant une arête vers la cible, en conciliant précision et rappel. Avec un meilleur score de 90 % pour GPT-5.4 et une médiane de 59 %, le classement fait apparaître des écarts substantiels entre les dix modèles évalués, sans saturation complète du benchmark.
La portée reste spécialisée : Graphwalks parents <128k teste une forme précise de raisonnement sur graphe, dans des contextes longs mais inférieurs à 128k tokens. Ses résultats ne résument donc pas les capacités générales d’un modèle. Le caractère public du jeu appelle aussi à considérer le risque méthodologique de contamination lors de l’interprétation des performances.
La rigueur comparative est limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Surtout, les dix modèles classés sont édités par OpenAI, également créateur du benchmark. Le classement renseigne ainsi sur les différences internes à cette gamme, mais ne constitue pas une source indépendante pour comparer les modèles OpenAI avec ceux d’autres éditeurs.
Sources des scores : llm-stats.