BrowseComp-zh

BrowseComp-zh est un benchmark à haute difficulté conçu par les auteurs de BrowseComp-ZH, Peilin Zhou et al., pour évaluer les agents fondés sur des LLM dans l’environnement du web chinois.

BrowseComp-zh est un benchmark à haute difficulté conçu par les auteurs de BrowseComp-ZH, Peilin Zhou et al., pour évaluer les agents fondés sur des LLM dans l’environnement du web chinois.

Il mesure la navigation web, la recherche d’information, le raisonnement multi-sauts et la prise en compte du contexte culturel. Ses questions partent de réponses courtes, objectives et vérifiables, mais exigent de rapprocher plusieurs informations au-delà d’une simple recherche. Il sert ainsi à comparer la capacité des modèles à gérer les particularités linguistiques, infrastructurelles et liées à la censure du web chinois.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs BrowseComp-ZH (Peilin Zhou et al.)
Capacités mesuréesCapacite de navigation web et de recherche d'information sur le web chinois, raisonnement multi-sauts, contexte culturel
ModalitéTexte
Type de questionsQuestions multi-sauts a reponse courte verifiable (navigation web)
Métrique d'évaluationPrécision (accuracy)
AccèsPublic
LicenceMIT
Langueschinois
Taille du jeu289 questions multi-sauts sur 11 domaines
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert70,3 %16 février 2026Auto-déclaré
2Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert69,9 %24 février 2026Auto-déclaré
3Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert69,5 %24 février 2026Auto-déclaré
4LongCat-Flash-Thinking-2601Meituan🟢 Ouvert69,0 %14 janvier 2026Auto-déclaré
5GLM-4.7Zhipu AI🟢 Ouvert66,6 %22 décembre 2025Auto-déclaré
6DeepSeek-V3.2DeepSeek🟢 Ouvert65,0 %1 décembre 2025Auto-déclaré
7DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert65,0 %1 décembre 2025Auto-déclaré
8Kimi K2 0905Moonshot AI🔒 Propriétaire62,3 %5 septembre 2025Auto-déclaré
9Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert62,1 %24 février 2026Auto-déclaré
10DeepSeek-V3.1DeepSeek🟢 Ouvert49,2 %10 janvier 2025Auto-déclaré
11MiniMax M2MiniMax🟢 Ouvert48,5 %27 octobre 2025Auto-déclaré
12DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert47,9 %29 septembre 2025Auto-déclaré
13DeepSeek-R1-0528DeepSeek🟢 Ouvert35,7 %28 mai 2025Auto-déclaré

Classement établi sur 13 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 65,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BrowseComp-zh indique qu’un modèle répond correctement à une forte proportion de questions nécessitant plusieurs étapes de recherche et de raisonnement sur le web chinois. Il traduit notamment une aptitude à retrouver, rapprocher et réconcilier des informations issues de contextes variés, tout en produisant une réponse courte et vérifiable.

L’interprétation du classement demande toutefois de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. Parmi les 13 modèles évalués dans la base, Qwen3.5-397B-A17B arrive en tête avec 70 %, contre une médiane de 65 %. Cet écart limité avec le niveau médian suggère un classement relativement resserré au sommet et réduit la portée pratique des petites différences. Une saturation partielle peut devenir un enjeu si les résultats continuent de progresser. Le caractère public du jeu crée aussi un risque potentiel de contamination. Enfin, sa portée reste ciblée sur 289 questions en chinois, réparties entre 11 domaines, et sur des tâches de navigation web multi-sauts propres à cet environnement.


Sources des scores : llm-stats.