Natural Questions

Natural Questions est un benchmark de question-réponse créé par Google AI Language et T. Kwiatkowski et al. Il repose sur de véritables requêtes anonymisées adressées au moteur de recherche Google et sur des contenus issus de Wikipédia.

Natural Questions est un benchmark de question-réponse créé par Google AI Language et T. Kwiatkowski et al. Il repose sur de véritables requêtes anonymisées adressées au moteur de recherche Google et sur des contenus issus de Wikipédia.

Il évalue la capacité d’un modèle à comprendre une demande ouverte, repérer un passage pertinent, produire une réponse longue ou courte, ou reconnaître qu’aucune réponse n’est disponible. Il sert ainsi à comparer les performances des modèles sur une tâche de recherche d’information et d’extraction de réponses en anglais.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle AI Language / T. Kwiatkowski et al.
Capacités mesuréesgénéraliste, raisonnement, recherche
ModalitéTexte
Type de questionsquestions ouvertes de recherche d'information et d'extraction de réponses depuis des pages Wikipédia, avec réponses longues, réponses courtes ou questions sans réponse
Métrique d'évaluationF1 pour les réponses longues et courtes
AccèsJeu de test privé (réponses non divulguées)
LicenceCC-BY-SA-3.0
Languesanglais
Taille du jeuenviron 323 000 exemples, dont 307 373 entraînement, 7 830 développement et 7 842 test
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemma 2 27BGoogle🟢 Ouvert34,5 %27 juin 2024Auto-déclaré
2Mistral NeMo InstructMistral AI🟢 Ouvert31,2 %18 juillet 2024Auto-déclaré
3Gemma 2 9BGoogle🟢 Ouvert29,2 %27 juin 2024Auto-déclaré
4Gemma 3n E4BGoogle🔒 Propriétaire20,9 %26 juin 2025Auto-déclaré
5Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert20,9 %20 mai 2025Auto-déclaré
6Gemma 3n E2BGoogle🔒 Propriétaire15,5 %26 juin 2025Auto-déclaré
7Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert15,5 %20 mai 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 20,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score F1 élevé traduit une meilleure capacité à retrouver et extraire les réponses attendues, aussi bien sous forme de passages longs que de réponses courtes, tout en traitant les questions sans réponse. La confidentialité des réponses du jeu de test favorise une évaluation sur des cibles non divulguées. La lecture du classement exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. La portée reste centrée sur des requêtes en anglais et sur l’extraction depuis Wikipédia, ce qui limite l’extrapolation à d’autres langues, sources ou formes de raisonnement. Dans la base, la médiane de 21 % et le meilleur résultat de 34 %, obtenu par Gemma 2 27B, montrent un écart notable entre le niveau central et la tête du classement, sans performance proche du maximum théorique. Enfin, six des sept modèles classés sont édités par Google, également codéveloppeur de Natural Questions. Ce classement ne constitue donc pas une source indépendante pour comparer les modèles Google à ceux d’autres éditeurs.


Sources des scores : llm-stats.