BrowseComp Long Context 128k
BrowseComp Long Context 128k est une configuration à contexte long du benchmark BrowseComp, créé par OpenAI avec Jason Wei et ses coauteurs. Il évalue des agents capables de naviguer de manière persistante sur le web afin de retrouver des informations factuelles difficiles d’accès et…
BrowseComp Long Context 128k est une configuration à contexte long du benchmark BrowseComp, créé par OpenAI avec Jason Wei et ses coauteurs. Il évalue des agents capables de naviguer de manière persistante sur le web afin de retrouver des informations factuelles difficiles d’accès et parfois entremêlées.
Les questions exigent un raisonnement stratégique, une recherche créative et l’interprétation des contenus récupérés. Les réponses attendues sont courtes et vérifiables. Le benchmark sert ainsi à comparer la capacité des modèles à conduire une recherche web complexe jusqu’à une réponse exacte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI (BrowseComp de base ; Jason Wei et al.) |
| Capacités mesurées | Navigation web persistante, raisonnement strategique et recherche creative d'informations difficiles a trouver, ici en configuration contexte long 128k. |
| Modalité | Texte |
| Type de questions | Questions factuelles a reponse courte verifiable (navigation web) |
| Métrique d'évaluation | Exactitude vs reponse de reference |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 1 266 questions |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 92,0 % | 11 décembre 2025 | Auto-déclaré |
| 2 | GPT-5 | OpenAI | 🔒 Propriétaire | 90,0 % | 7 août 2025 | Auto-déclaré |
| 3 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 90,0 % | 13 novembre 2025 | Auto-déclaré |
| 4 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 90,0 % | 12 novembre 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 90,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle retrouve fréquemment la réponse de référence malgré la difficulté de localisation et l’enchevêtrement des informations. L’exactitude fournit un critère clair, adapté aux réponses factuelles courtes, mais elle résume la réussite finale sans caractériser directement la qualité du parcours de navigation ou du raisonnement stratégique. La fiabilité comparative doit aussi être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment.
Le score médian de 90 % et le résultat de 92 % obtenu par GPT-5.2 placent les modèles évalués dans une zone resserrée, ce qui limite la capacité du classement à fortement les départager et suggère une forme de saturation sur cet échantillon. L’accès public au jeu appelle également à considérer un risque de contamination lors de l’interprétation des performances. Enfin, la portée reste centrée sur des questions anglophones de navigation web à réponse courte. Les quatre modèles classés étant édités par OpenAI, également impliqué dans le développement du benchmark, ce classement n’est pas une source indépendante pour comparer OpenAI à d’autres éditeurs.
Sources des scores : llm-stats.