BrowseComp
Créé par OpenAI en 2025, BrowseComp évalue la capacité d’agents IA à mener des recherches persistantes sur le web. Ses questions ouvertes exigent de naviguer entre plusieurs sources afin de retrouver des informations difficiles d’accès, imbriquées ou peu évidentes.
Créé par OpenAI en 2025, BrowseComp évalue la capacité d’agents IA à mener des recherches persistantes sur le web. Ses questions ouvertes exigent de naviguer entre plusieurs sources afin de retrouver des informations difficiles d’accès, imbriquées ou peu évidentes.
Le benchmark privilégie des réponses courtes, comparables à des références vérifiables. Il sert ainsi à distinguer les modèles capables de dépasser une recherche superficielle, en combinant persévérance dans la collecte d’informations et créativité dans les parcours de navigation.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | agents, raisonnement, recherche |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte nécessitant une navigation web agentique |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 1 266 questions |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (57)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI | ▫ n.d. | 91,2 % | 16 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 90,4 % | 9 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.5 Pro | OpenAI | 🔒 Propriétaire | 90,1 % | 23 avril 2026 | Auto-déclaré |
| 4 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 87,5 % | 9 juillet 2026 | Auto-déclaré |
| 5 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 86,9 % | — | Auto-déclaré |
| 6 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 86,3 % | 20 avril 2026 | Auto-déclaré |
| 7 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 86,2 % | 24 juin 2026 | Auto-déclaré |
| 8 | Gemini 3.1 Pro Preview | ▫ n.d. | 85,9 % | 19 février 2026 | Auto-déclaré | |
| 9 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 84,9 % | 24 juin 2026 | Auto-déclaré |
| 10 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 84,7 % | 30 juin 2026 | Auto-déclaré |
| 11 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 84,4 % | 23 avril 2026 | Auto-déclaré |
| 12 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 84,3 % | 28 mai 2026 | Auto-déclaré |
| 13 | Hy3 | Tencent | 🟢 Ouvert | 84,2 % | 6 juillet 2026 | Auto-déclaré |
| 14 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 84,0 % | 5 février 2026 | Auto-déclaré |
| 15 | MiniMax M3 | MiniMax | 🟢 Ouvert | 83,5 % | 1 juin 2026 | Auto-déclaré |
| 16 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 83,4 % | 23 avril 2026 | Auto-déclaré |
| 17 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 83,3 % | 9 juillet 2026 | Auto-déclaré |
| 18 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 82,7 % | 5 mars 2026 | Auto-déclaré |
| 19 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 79,3 % | 16 avril 2026 | Auto-déclaré |
| 20 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 79,3 % | 7 avril 2026 | Auto-déclaré |
| 21 | GPT-5.2 Pro | OpenAI | 🔒 Propriétaire | 77,9 % | 11 décembre 2025 | Auto-déclaré |
| 22 | Seed 2.0 Pro | ByteDance | 🔒 Propriétaire | 77,3 % | 14 février 2026 | Auto-déclaré |
| 23 | MiniMax M2.5 | MiniMax | 🟢 Ouvert | 76,3 % | 12 février 2026 | Auto-déclaré |
| 24 | GLM-5 | Zhipu AI | 🟢 Ouvert | 75,9 % | 11 février 2026 | Auto-déclaré |
| 25 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 74,9 % | 27 janvier 2026 | Auto-déclaré |
| 26 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 74,7 % | 17 février 2026 | Auto-déclaré |
| 27 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 73,2 % | 23 avril 2026 | Auto-déclaré |
| 28 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,0 % | 16 février 2026 | Auto-déclaré |
| 29 | Step-3.5-Flash | StepFun | 🟢 Ouvert | 69,0 % | 2 février 2026 | Auto-déclaré |
| 30 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 65,8 % | 11 décembre 2025 | Auto-déclaré |
| 31 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,8 % | 24 février 2026 | Auto-déclaré |
| 32 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 62,0 % | 23 décembre 2025 | Auto-déclaré |
| 33 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,0 % | 24 février 2026 | Auto-déclaré |
| 34 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,0 % | 24 février 2026 | Auto-déclaré |
| 35 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 60,2 % | 5 septembre 2025 | Auto-déclaré |
| 36 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 58,3 % | 16 décembre 2025 | Auto-déclaré |
| 37 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 56,6 % | 14 janvier 2026 | Auto-déclaré |
| 38 | GPT-5 | OpenAI | 🔒 Propriétaire | 54,9 % | 7 août 2025 | Auto-déclaré |
| 39 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 52,0 % | 22 décembre 2025 | Auto-déclaré |
| 40 | o4-mini | OpenAI | 🔒 Propriétaire | 51,5 % | 16 avril 2025 | Auto-déclaré |
| 41 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 51,4 % | 1 décembre 2025 | Auto-déclaré |
| 42 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 51,4 % | 1 décembre 2025 | Auto-déclaré |
| 43 | o3 | OpenAI | 🔒 Propriétaire | 49,7 % | 16 avril 2025 | Auto-déclaré |
| 44 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 49,5 % | 6 mars 2026 | Auto-déclaré |
| 45 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 48,6 % | 29 avril 2026 | Auto-déclaré |
| 46 | GLM-4.6 | Zhipu AI | 🟢 Ouvert | 45,1 % | 30 septembre 2025 | Auto-déclaré |
| 47 | Grok 4 Fast | xAI | 🔒 Propriétaire | 44,9 % | 28 août 2025 | Auto-déclaré |
| 48 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 44,4 % | 4 juin 2026 | Auto-déclaré |
| 49 | MiniMax M2 | MiniMax | 🟢 Ouvert | 44,0 % | 27 octobre 2025 | Auto-déclaré |
| 50 | GLM-4.7-Flash | Zhipu AI | 🟢 Ouvert | 42,8 % | 19 janvier 2026 | Auto-déclaré |
| 51 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 40,1 % | 29 septembre 2025 | Auto-déclaré |
| 52 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 35,5 % | 6 mars 2026 | Auto-déclaré |
| 53 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 31,3 % | 11 mars 2026 | Auto-déclaré |
| 54 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 30,0 % | 10 janvier 2025 | Auto-déclaré |
| 55 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 26,4 % | 28 juillet 2025 | Auto-déclaré |
| 56 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 21,3 % | 28 juillet 2025 | Auto-déclaré |
| 57 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 8,9 % | 28 mai 2025 | Auto-déclaré |
Classement établi sur 57 modèles évalués, dont 29 de grands éditeurs. Score médian de l'ensemble : 69,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BrowseComp indique qu’un agent retrouve fréquemment la réponse de référence malgré la difficulté de la recherche, tout en produisant une réponse concise. La métrique d’accuracy mesure directement la proportion de réponses correctes, mais la fiabilité comparative du classement doit être nuancée : les scores recensés sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un cadre de mesure indépendant unique.
Avec une médiane de 63 % parmi 52 modèles et un meilleur résultat de 90 % pour GPT-5.5 Pro, le classement révèle un écart notable entre la performance centrale de l’ensemble et celle du modèle de tête. Le maximum restant inférieur à 100 %, BrowseComp n’apparaît pas totalement saturé dans cette base. Son accès public crée toutefois un risque potentiel de contamination des évaluations futures. Sa portée demeure ciblée : il mesure la recherche web agentique en anglais, sur des questions ouvertes à réponse courte. Il ne résume donc pas, à lui seul, les capacités générales d’un modèle en dehors de ce cadre.
Sources des scores : llm-stats.