WideSearch

WideSearch est un benchmark de recherche agentique créé par ByteDance Seed. Il évalue la capacité des modèles à mener des recherches larges et parallèles dans plusieurs sources, afin de recueillir de manière exhaustive des informations atomiques et vérifiables.

WideSearch est un benchmark de recherche agentique créé par ByteDance Seed. Il évalue la capacité des modèles à mener des recherches larges et parallèles dans plusieurs sources, afin de recueillir de manière exhaustive des informations atomiques et vérifiables.

Les tâches couvrent de nombreux domaines en anglais et en chinois. Elles mesurent à la fois la recherche d’information à large couverture et la synthèse des résultats dans une sortie structurée, ce qui permet de comparer les performances des modèles sur des missions complexes de collecte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkByteDance Seed
Capacités mesuréesRecherche d'information large et parallèle à travers plusieurs sources, collecte exhaustive et synthèse en sortie structurée
ModalitéTexte
Type de questionstâches agentiques de recherche d'information à large couverture (collecte d'informations atomiques vérifiables)
Métrique d'évaluationtaux de réussite / vérification item par item (F1 au niveau item)
AccèsPublic
Languesanglais et chinois (bilingue)
Taille du jeu200 questions (100 anglais + 100 chinois), 15+ domaines
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.6Moonshot AI🟢 Ouvert80,8 %20 avril 2026Auto-déclaré
2Kimi K2.5Moonshot AI🟢 Ouvert79,0 %27 janvier 2026Auto-déclaré
3Hy3Tencent🟢 Ouvert76,4 %6 juillet 2026Auto-déclaré
4Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire74,3 %31 mars 2026Auto-déclaré
5Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert74,0 %16 février 2026Auto-déclaré
6Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert61,1 %24 février 2026Auto-déclaré
7Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert60,5 %24 février 2026Auto-déclaré
8Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert60,1 %16 avril 2026Auto-déclaré
9Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert57,1 %24 février 2026Auto-déclaré

Classement établi sur 9 modèles évalués. Score médian de l'ensemble : 74,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé dans WideSearch indique qu’un modèle retrouve une part importante des éléments attendus tout en limitant les réponses incorrectes, selon une vérification item par item et un calcul F1 au niveau de chaque élément. Il traduit donc une bonne capacité à coordonner une recherche étendue, à couvrir plusieurs sources et à restituer les informations sous une forme structurée. Le classement des huit modèles évalués montre un niveau médian de 68 %, tandis que Kimi K2.6 atteint 81 %. Cet écart révèle une avance du meilleur modèle, mais aussi une marge de progression générale avant une réussite complète sur ces tâches. La lecture comparative doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure entièrement uniforme. L’accès public peut aussi accroître le risque de contamination au fil du temps. Enfin, la portée reste celle du jeu lui-même, soit des tâches bilingues de recherche large dans plus de quinze domaines. Le meilleur résultat ne signale pas encore une saturation du benchmark.


Sources des scores : llm-stats.