Natural Questions
Natural Questions est un benchmark de question-réponse créé par Google AI Language et T. Kwiatkowski et al. Il repose sur de véritables requêtes anonymisées adressées au moteur de recherche Google et sur des contenus issus de Wikipédia.
Natural Questions est un benchmark de question-réponse créé par Google AI Language et T. Kwiatkowski et al. Il repose sur de véritables requêtes anonymisées adressées au moteur de recherche Google et sur des contenus issus de Wikipédia.
Il évalue la capacité d’un modèle à comprendre une demande ouverte, repérer un passage pertinent, produire une réponse longue ou courte, ou reconnaître qu’aucune réponse n’est disponible. Il sert ainsi à comparer les performances des modèles sur une tâche de recherche d’information et d’extraction de réponses en anglais.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google AI Language / T. Kwiatkowski et al. |
| Capacités mesurées | généraliste, raisonnement, recherche |
| Modalité | Texte |
| Type de questions | questions ouvertes de recherche d'information et d'extraction de réponses depuis des pages Wikipédia, avec réponses longues, réponses courtes ou questions sans réponse |
| Métrique d'évaluation | F1 pour les réponses longues et courtes |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | CC-BY-SA-3.0 |
| Langues | anglais |
| Taille du jeu | environ 323 000 exemples, dont 307 373 entraînement, 7 830 développement et 7 842 test |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemma 2 27B | 🟢 Ouvert | 34,5 % | 27 juin 2024 | Auto-déclaré | |
| 2 | Mistral NeMo Instruct | Mistral AI | 🟢 Ouvert | 31,2 % | 18 juillet 2024 | Auto-déclaré |
| 3 | Gemma 2 9B | 🟢 Ouvert | 29,2 % | 27 juin 2024 | Auto-déclaré | |
| 4 | Gemma 3n E4B | 🔒 Propriétaire | 20,9 % | 26 juin 2025 | Auto-déclaré | |
| 5 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 20,9 % | 20 mai 2025 | Auto-déclaré | |
| 6 | Gemma 3n E2B | 🔒 Propriétaire | 15,5 % | 26 juin 2025 | Auto-déclaré | |
| 7 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 15,5 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 20,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score F1 élevé traduit une meilleure capacité à retrouver et extraire les réponses attendues, aussi bien sous forme de passages longs que de réponses courtes, tout en traitant les questions sans réponse. La confidentialité des réponses du jeu de test favorise une évaluation sur des cibles non divulguées. La lecture du classement exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. La portée reste centrée sur des requêtes en anglais et sur l’extraction depuis Wikipédia, ce qui limite l’extrapolation à d’autres langues, sources ou formes de raisonnement. Dans la base, la médiane de 21 % et le meilleur résultat de 34 %, obtenu par Gemma 2 27B, montrent un écart notable entre le niveau central et la tête du classement, sans performance proche du maximum théorique. Enfin, six des sept modèles classés sont édités par Google, également codéveloppeur de Natural Questions. Ce classement ne constitue donc pas une source indépendante pour comparer les modèles Google à ceux d’autres éditeurs.
Sources des scores : llm-stats.