WideSearch
WideSearch est un benchmark de recherche agentique créé par ByteDance Seed. Il évalue la capacité des modèles à mener des recherches larges et parallèles dans plusieurs sources, afin de recueillir de manière exhaustive des informations atomiques et vérifiables.
WideSearch est un benchmark de recherche agentique créé par ByteDance Seed. Il évalue la capacité des modèles à mener des recherches larges et parallèles dans plusieurs sources, afin de recueillir de manière exhaustive des informations atomiques et vérifiables.
Les tâches couvrent de nombreux domaines en anglais et en chinois. Elles mesurent à la fois la recherche d’information à large couverture et la synthèse des résultats dans une sortie structurée, ce qui permet de comparer les performances des modèles sur des missions complexes de collecte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | ByteDance Seed |
| Capacités mesurées | Recherche d'information large et parallèle à travers plusieurs sources, collecte exhaustive et synthèse en sortie structurée |
| Modalité | Texte |
| Type de questions | tâches agentiques de recherche d'information à large couverture (collecte d'informations atomiques vérifiables) |
| Métrique d'évaluation | taux de réussite / vérification item par item (F1 au niveau item) |
| Accès | Public |
| Langues | anglais et chinois (bilingue) |
| Taille du jeu | 200 questions (100 anglais + 100 chinois), 15+ domaines |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 80,8 % | 20 avril 2026 | Auto-déclaré |
| 2 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 79,0 % | 27 janvier 2026 | Auto-déclaré |
| 3 | Hy3 | Tencent | 🟢 Ouvert | 76,4 % | 6 juillet 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 74,3 % | 31 mars 2026 | Auto-déclaré |
| 5 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,0 % | 16 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,1 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,5 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,1 % | 16 avril 2026 | Auto-déclaré |
| 9 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,1 % | 24 février 2026 | Auto-déclaré |
Classement établi sur 9 modèles évalués. Score médian de l'ensemble : 74,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé dans WideSearch indique qu’un modèle retrouve une part importante des éléments attendus tout en limitant les réponses incorrectes, selon une vérification item par item et un calcul F1 au niveau de chaque élément. Il traduit donc une bonne capacité à coordonner une recherche étendue, à couvrir plusieurs sources et à restituer les informations sous une forme structurée. Le classement des huit modèles évalués montre un niveau médian de 68 %, tandis que Kimi K2.6 atteint 81 %. Cet écart révèle une avance du meilleur modèle, mais aussi une marge de progression générale avant une réussite complète sur ces tâches. La lecture comparative doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure entièrement uniforme. L’accès public peut aussi accroître le risque de contamination au fil du temps. Enfin, la portée reste celle du jeu lui-même, soit des tâches bilingues de recherche large dans plus de quinze domaines. Le meilleur résultat ne signale pas encore une saturation du benchmark.
Sources des scores : llm-stats.