BrowseComp Long Context 128k

BrowseComp Long Context 128k est une configuration à contexte long du benchmark BrowseComp, créé par OpenAI avec Jason Wei et ses coauteurs. Il évalue des agents capables de naviguer de manière persistante sur le web afin de retrouver des informations factuelles difficiles d’accès et…

BrowseComp Long Context 128k est une configuration à contexte long du benchmark BrowseComp, créé par OpenAI avec Jason Wei et ses coauteurs. Il évalue des agents capables de naviguer de manière persistante sur le web afin de retrouver des informations factuelles difficiles d’accès et parfois entremêlées.

Les questions exigent un raisonnement stratégique, une recherche créative et l’interprétation des contenus récupérés. Les réponses attendues sont courtes et vérifiables. Le benchmark sert ainsi à comparer la capacité des modèles à conduire une recherche web complexe jusqu’à une réponse exacte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI (BrowseComp de base ; Jason Wei et al.)
Capacités mesuréesNavigation web persistante, raisonnement strategique et recherche creative d'informations difficiles a trouver, ici en configuration contexte long 128k.
ModalitéTexte
Type de questionsQuestions factuelles a reponse courte verifiable (navigation web)
Métrique d'évaluationExactitude vs reponse de reference
AccèsPublic
LanguesAnglais
Taille du jeu1 266 questions
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.2OpenAI🔒 Propriétaire92,0 %11 décembre 2025Auto-déclaré
2GPT-5OpenAI🔒 Propriétaire90,0 %7 août 2025Auto-déclaré
3GPT-5.1OpenAI🔒 Propriétaire90,0 %13 novembre 2025Auto-déclaré
4GPT-5.1 InstantOpenAI🔒 Propriétaire90,0 %12 novembre 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 90,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle retrouve fréquemment la réponse de référence malgré la difficulté de localisation et l’enchevêtrement des informations. L’exactitude fournit un critère clair, adapté aux réponses factuelles courtes, mais elle résume la réussite finale sans caractériser directement la qualité du parcours de navigation ou du raisonnement stratégique. La fiabilité comparative doit aussi être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment.

Le score médian de 90 % et le résultat de 92 % obtenu par GPT-5.2 placent les modèles évalués dans une zone resserrée, ce qui limite la capacité du classement à fortement les départager et suggère une forme de saturation sur cet échantillon. L’accès public au jeu appelle également à considérer un risque de contamination lors de l’interprétation des performances. Enfin, la portée reste centrée sur des questions anglophones de navigation web à réponse courte. Les quatre modèles classés étant édités par OpenAI, également impliqué dans le développement du benchmark, ce classement n’est pas une source indépendante pour comparer OpenAI à d’autres éditeurs.


Sources des scores : llm-stats.