BrowseComp-zh
BrowseComp-zh est un benchmark à haute difficulté conçu par les auteurs de BrowseComp-ZH, Peilin Zhou et al., pour évaluer les agents fondés sur des LLM dans l’environnement du web chinois.
BrowseComp-zh est un benchmark à haute difficulté conçu par les auteurs de BrowseComp-ZH, Peilin Zhou et al., pour évaluer les agents fondés sur des LLM dans l’environnement du web chinois.
Il mesure la navigation web, la recherche d’information, le raisonnement multi-sauts et la prise en compte du contexte culturel. Ses questions partent de réponses courtes, objectives et vérifiables, mais exigent de rapprocher plusieurs informations au-delà d’une simple recherche. Il sert ainsi à comparer la capacité des modèles à gérer les particularités linguistiques, infrastructurelles et liées à la censure du web chinois.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs BrowseComp-ZH (Peilin Zhou et al.) |
| Capacités mesurées | Capacite de navigation web et de recherche d'information sur le web chinois, raisonnement multi-sauts, contexte culturel |
| Modalité | Texte |
| Type de questions | Questions multi-sauts a reponse courte verifiable (navigation web) |
| Métrique d'évaluation | Précision (accuracy) |
| Accès | Public |
| Licence | MIT |
| Langues | chinois |
| Taille du jeu | 289 questions multi-sauts sur 11 domaines |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 16 février 2026 | Auto-déclaré |
| 2 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,9 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,5 % | 24 février 2026 | Auto-déclaré |
| 4 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 69,0 % | 14 janvier 2026 | Auto-déclaré |
| 5 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 66,6 % | 22 décembre 2025 | Auto-déclaré |
| 6 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 65,0 % | 1 décembre 2025 | Auto-déclaré |
| 7 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 65,0 % | 1 décembre 2025 | Auto-déclaré |
| 8 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 62,3 % | 5 septembre 2025 | Auto-déclaré |
| 9 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,1 % | 24 février 2026 | Auto-déclaré |
| 10 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 49,2 % | 10 janvier 2025 | Auto-déclaré |
| 11 | MiniMax M2 | MiniMax | 🟢 Ouvert | 48,5 % | 27 octobre 2025 | Auto-déclaré |
| 12 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 47,9 % | 29 septembre 2025 | Auto-déclaré |
| 13 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 35,7 % | 28 mai 2025 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 65,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BrowseComp-zh indique qu’un modèle répond correctement à une forte proportion de questions nécessitant plusieurs étapes de recherche et de raisonnement sur le web chinois. Il traduit notamment une aptitude à retrouver, rapprocher et réconcilier des informations issues de contextes variés, tout en produisant une réponse courte et vérifiable.
L’interprétation du classement demande toutefois de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. Parmi les 13 modèles évalués dans la base, Qwen3.5-397B-A17B arrive en tête avec 70 %, contre une médiane de 65 %. Cet écart limité avec le niveau médian suggère un classement relativement resserré au sommet et réduit la portée pratique des petites différences. Une saturation partielle peut devenir un enjeu si les résultats continuent de progresser. Le caractère public du jeu crée aussi un risque potentiel de contamination. Enfin, sa portée reste ciblée sur 289 questions en chinois, réparties entre 11 domaines, et sur des tâches de navigation web multi-sauts propres à cet environnement.
Sources des scores : llm-stats.