DeepSearchQA
DeepSearchQA est un benchmark conçu par Google DeepMind, sous la direction d’Elena Gribovskaya et de ses coauteurs, pour évaluer les capacités de recherche approfondie et de réponse aux questions des agents d’IA.
DeepSearchQA est un benchmark conçu par Google DeepMind, sous la direction d’Elena Gribovskaya et de ses coauteurs, pour évaluer les capacités de recherche approfondie et de réponse aux questions des agents d’IA.
Il mesure leur aptitude à exécuter des recherches multi-étapes, à relier des informations issues de plusieurs sauts de raisonnement et à restituer des listes exhaustives. Il complète ainsi les évaluations centrées sur la factualité d’une réponse unique en testant la couverture complète de domaines de connaissance complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind (Elena Gribovskaya et al.) |
| Capacités mesurées | Évalue les agents de recherche profonde sur leur aptitude à exécuter des plans de recherche multi-sauts et à produire des réponses exhaustives, au-delà de la simple factualité à réponse unique. |
| Modalité | Texte |
| Type de questions | tâches de recherche multi-étapes (multi-hop) exigeant des listes de réponses exhaustives |
| Métrique d'évaluation | exactitude « Fully Correct » (ensemble de réponses identique à la vérité terrain, ni omission ni intrus) |
| Accès | Public |
| Licence | CC BY 4.0 |
| Taille du jeu | 900 tâches (17 domaines) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI | ▫ n.d. | 95,0 % | 16 juillet 2026 | Auto-déclaré |
| 2 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 93,1 % | 28 mai 2026 | Auto-déclaré |
| 3 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 91,3 % | 5 février 2026 | Auto-déclaré |
| 4 | Hy3 | Tencent | 🟢 Ouvert | 91,0 % | 6 juillet 2026 | Auto-déclaré |
| 5 | MiMo-V2-Pro | Xiaomi | 🔒 Propriétaire | 86,7 % | 18 mars 2026 | Auto-déclaré |
| 6 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 83,0 % | 20 avril 2026 | Auto-déclaré |
| 7 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 77,1 % | 27 janvier 2026 | Auto-déclaré |
| 8 | Muse Spark | Meta | 🔒 Propriétaire | 74,8 % | 8 avril 2026 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 88,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur DeepSearchQA signifie qu’un agent retrouve exactement l’ensemble attendu, sans omission ni réponse intruse. La métrique Fully Correct impose donc une exigence stricte, particulièrement adaptée aux tâches dont la réussite dépend autant de l’exhaustivité que de la justesse de chaque élément. La portée reste toutefois circonscrite aux tâches de recherche multi-sauts et aux 17 domaines couverts, ce qui ne résume pas toutes les capacités d’un modèle.
Le classement montre un niveau globalement élevé parmi les six modèles évalués. Claude Opus 4.8 atteint 93 %, contre une médiane de 85 %, soit un écart limité de huit points. Cette concentration en haut de l’échelle peut réduire le pouvoir discriminant du benchmark à mesure que les performances progressent, avec un risque de saturation. L’accès public facilite par ailleurs l’usage du jeu, mais crée aussi un risque de contamination lors de l’entraînement ou de l’optimisation. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison repose moins sur une mesure indépendante et uniformément contrôlée.
Sources des scores : llm-stats.