DeepSearchQA

DeepSearchQA est un benchmark conçu par Google DeepMind, sous la direction d’Elena Gribovskaya et de ses coauteurs, pour évaluer les capacités de recherche approfondie et de réponse aux questions des agents d’IA.

DeepSearchQA est un benchmark conçu par Google DeepMind, sous la direction d’Elena Gribovskaya et de ses coauteurs, pour évaluer les capacités de recherche approfondie et de réponse aux questions des agents d’IA.

Il mesure leur aptitude à exécuter des recherches multi-étapes, à relier des informations issues de plusieurs sauts de raisonnement et à restituer des listes exhaustives. Il complète ainsi les évaluations centrées sur la factualité d’une réponse unique en testant la couverture complète de domaines de connaissance complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind (Elena Gribovskaya et al.)
Capacités mesuréesÉvalue les agents de recherche profonde sur leur aptitude à exécuter des plans de recherche multi-sauts et à produire des réponses exhaustives, au-delà de la simple factualité à réponse unique.
ModalitéTexte
Type de questionstâches de recherche multi-étapes (multi-hop) exigeant des listes de réponses exhaustives
Métrique d'évaluationexactitude « Fully Correct » (ensemble de réponses identique à la vérité terrain, ni omission ni intrus)
AccèsPublic
LicenceCC BY 4.0
Taille du jeu900 tâches (17 domaines)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K3Moonshot AI▫ n.d.95,0 %16 juillet 2026Auto-déclaré
2Claude Opus 4.8Anthropic🔒 Propriétaire93,1 %28 mai 2026Auto-déclaré
3Claude Opus 4.6Anthropic🔒 Propriétaire91,3 %5 février 2026Auto-déclaré
4Hy3Tencent🟢 Ouvert91,0 %6 juillet 2026Auto-déclaré
5MiMo-V2-ProXiaomi🔒 Propriétaire86,7 %18 mars 2026Auto-déclaré
6Kimi K2.6Moonshot AI🟢 Ouvert83,0 %20 avril 2026Auto-déclaré
7Kimi K2.5Moonshot AI🟢 Ouvert77,1 %27 janvier 2026Auto-déclaré
8Muse SparkMeta🔒 Propriétaire74,8 %8 avril 2026Auto-déclaré

Classement établi sur 8 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 88,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur DeepSearchQA signifie qu’un agent retrouve exactement l’ensemble attendu, sans omission ni réponse intruse. La métrique Fully Correct impose donc une exigence stricte, particulièrement adaptée aux tâches dont la réussite dépend autant de l’exhaustivité que de la justesse de chaque élément. La portée reste toutefois circonscrite aux tâches de recherche multi-sauts et aux 17 domaines couverts, ce qui ne résume pas toutes les capacités d’un modèle.

Le classement montre un niveau globalement élevé parmi les six modèles évalués. Claude Opus 4.8 atteint 93 %, contre une médiane de 85 %, soit un écart limité de huit points. Cette concentration en haut de l’échelle peut réduire le pouvoir discriminant du benchmark à mesure que les performances progressent, avec un risque de saturation. L’accès public facilite par ailleurs l’usage du jeu, mais crée aussi un risque de contamination lors de l’entraînement ou de l’optimisation. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison repose moins sur une mesure indépendante et uniformément contrôlée.


Sources des scores : llm-stats.