BrowseComp

Créé par OpenAI en 2025, BrowseComp évalue la capacité d’agents IA à mener des recherches persistantes sur le web. Ses questions ouvertes exigent de naviguer entre plusieurs sources afin de retrouver des informations difficiles d’accès, imbriquées ou peu évidentes.

Créé par OpenAI en 2025, BrowseComp évalue la capacité d’agents IA à mener des recherches persistantes sur le web. Ses questions ouvertes exigent de naviguer entre plusieurs sources afin de retrouver des informations difficiles d’accès, imbriquées ou peu évidentes.

Le benchmark privilégie des réponses courtes, comparables à des références vérifiables. Il sert ainsi à distinguer les modèles capables de dépasser une recherche superficielle, en combinant persévérance dans la collecte d’informations et créativité dans les parcours de navigation.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesagents, raisonnement, recherche
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte nécessitant une navigation web agentique
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu1 266 questions
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (57)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K3Moonshot AI▫ n.d.91,2 %16 juillet 2026Auto-déclaré
2GPT-5.6 SolOpenAI🔒 Propriétaire90,4 %9 juillet 2026Auto-déclaré
3GPT-5.5 ProOpenAI🔒 Propriétaire90,1 %23 avril 2026Auto-déclaré
4GPT-5.6 TerraOpenAI🔒 Propriétaire87,5 %9 juillet 2026Auto-déclaré
5Claude Mythos PreviewAnthropic🔒 Propriétaire86,9 %Auto-déclaré
6Kimi K2.6Moonshot AI🟢 Ouvert86,3 %20 avril 2026Auto-déclaré
7Seed 2.1 ProByteDance🔒 Propriétaire86,2 %24 juin 2026Auto-déclaré
8Gemini 3.1 Pro PreviewGoogle▫ n.d.85,9 %19 février 2026Auto-déclaré
9Seed 2.1 TurboByteDance🔒 Propriétaire84,9 %24 juin 2026Auto-déclaré
10Claude Sonnet 5Anthropic🔒 Propriétaire84,7 %30 juin 2026Auto-déclaré
11GPT-5.5OpenAI🔒 Propriétaire84,4 %23 avril 2026Auto-déclaré
12Claude Opus 4.8Anthropic🔒 Propriétaire84,3 %28 mai 2026Auto-déclaré
13Hy3Tencent🟢 Ouvert84,2 %6 juillet 2026Auto-déclaré
14Claude Opus 4.6Anthropic🔒 Propriétaire84,0 %5 février 2026Auto-déclaré
15MiniMax M3MiniMax🟢 Ouvert83,5 %1 juin 2026Auto-déclaré
16DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert83,4 %23 avril 2026Auto-déclaré
17GPT-5.6 LunaOpenAI🔒 Propriétaire83,3 %9 juillet 2026Auto-déclaré
18GPT-4.5OpenAI🔒 Propriétaire82,7 %5 mars 2026Auto-déclaré
19Claude Opus 4.7Anthropic🔒 Propriétaire79,3 %16 avril 2026Auto-déclaré
20GLM-5.1Zhipu AI🟢 Ouvert79,3 %7 avril 2026Auto-déclaré
21GPT-5.2 ProOpenAI🔒 Propriétaire77,9 %11 décembre 2025Auto-déclaré
22Seed 2.0 ProByteDance🔒 Propriétaire77,3 %14 février 2026Auto-déclaré
23MiniMax M2.5MiniMax🟢 Ouvert76,3 %12 février 2026Auto-déclaré
24GLM-5Zhipu AI🟢 Ouvert75,9 %11 février 2026Auto-déclaré
25Kimi K2.5Moonshot AI🟢 Ouvert74,9 %27 janvier 2026Auto-déclaré
26Claude Sonnet 4.6Anthropic🔒 Propriétaire74,7 %17 février 2026Auto-déclaré
27DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert73,2 %23 avril 2026Auto-déclaré
28Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert69,0 %16 février 2026Auto-déclaré
29Step-3.5-FlashStepFun🟢 Ouvert69,0 %2 février 2026Auto-déclaré
30GPT-5.2OpenAI🔒 Propriétaire65,8 %11 décembre 2025Auto-déclaré
31Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert63,8 %24 février 2026Auto-déclaré
32MiniMax M2.1MiniMax🟢 Ouvert62,0 %23 décembre 2025Auto-déclaré
33Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert61,0 %24 février 2026Auto-déclaré
34Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert61,0 %24 février 2026Auto-déclaré
35Kimi K2 0905Moonshot AI🔒 Propriétaire60,2 %5 septembre 2025Auto-déclaré
36MiMo-V2-FlashXiaomi🟢 Ouvert58,3 %16 décembre 2025Auto-déclaré
37LongCat-Flash-Thinking-2601Meituan🟢 Ouvert56,6 %14 janvier 2026Auto-déclaré
38GPT-5OpenAI🔒 Propriétaire54,9 %7 août 2025Auto-déclaré
39GLM-4.7Zhipu AI🟢 Ouvert52,0 %22 décembre 2025Auto-déclaré
40o4-miniOpenAI🔒 Propriétaire51,5 %16 avril 2025Auto-déclaré
41DeepSeek-V3.2DeepSeek🟢 Ouvert51,4 %1 décembre 2025Auto-déclaré
42DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert51,4 %1 décembre 2025Auto-déclaré
43o3OpenAI🔒 Propriétaire49,7 %16 avril 2025Auto-déclaré
44Sarvam-105BSarvam AI🟢 Ouvert49,5 %6 mars 2026Auto-déclaré
45Mistral Medium 3.5Mistral AI🟢 Ouvert48,6 %29 avril 2026Auto-déclaré
46GLM-4.6Zhipu AI🟢 Ouvert45,1 %30 septembre 2025Auto-déclaré
47Grok 4 FastxAI🔒 Propriétaire44,9 %28 août 2025Auto-déclaré
48Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert44,4 %4 juin 2026Auto-déclaré
49MiniMax M2MiniMax🟢 Ouvert44,0 %27 octobre 2025Auto-déclaré
50GLM-4.7-FlashZhipu AI🟢 Ouvert42,8 %19 janvier 2026Auto-déclaré
51DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert40,1 %29 septembre 2025Auto-déclaré
52Sarvam-30BSarvam AI🟢 Ouvert35,5 %6 mars 2026Auto-déclaré
53Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert31,3 %11 mars 2026Auto-déclaré
54DeepSeek-V3.1DeepSeek🟢 Ouvert30,0 %10 janvier 2025Auto-déclaré
55GLM-4.5Zhipu AI🟢 Ouvert26,4 %28 juillet 2025Auto-déclaré
56GLM-4.5-AirZhipu AI🟢 Ouvert21,3 %28 juillet 2025Auto-déclaré
57DeepSeek-R1-0528DeepSeek🟢 Ouvert8,9 %28 mai 2025Auto-déclaré

Classement établi sur 57 modèles évalués, dont 29 de grands éditeurs. Score médian de l'ensemble : 69,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BrowseComp indique qu’un agent retrouve fréquemment la réponse de référence malgré la difficulté de la recherche, tout en produisant une réponse concise. La métrique d’accuracy mesure directement la proportion de réponses correctes, mais la fiabilité comparative du classement doit être nuancée : les scores recensés sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un cadre de mesure indépendant unique.

Avec une médiane de 63 % parmi 52 modèles et un meilleur résultat de 90 % pour GPT-5.5 Pro, le classement révèle un écart notable entre la performance centrale de l’ensemble et celle du modèle de tête. Le maximum restant inférieur à 100 %, BrowseComp n’apparaît pas totalement saturé dans cette base. Son accès public crée toutefois un risque potentiel de contamination des évaluations futures. Sa portée demeure ciblée : il mesure la recherche web agentique en anglais, sur des questions ouvertes à réponse courte. Il ne résume donc pas, à lui seul, les capacités générales d’un modèle en dehors de ce cadre.


Sources des scores : llm-stats.