BoolQ

BoolQ est un benchmark de compréhension de lecture créé par Google AI Language, sous la direction de Christopher Clark et ses coauteurs. Il repose sur des questions naturelles auxquelles un modèle doit répondre par oui ou non en s’appuyant sur un passage.

BoolQ est un benchmark de compréhension de lecture créé par Google AI Language, sous la direction de Christopher Clark et ses coauteurs. Il repose sur des questions naturelles auxquelles un modèle doit répondre par oui ou non en s’appuyant sur un passage.

Son intérêt tient aux inférences proches de l’implication textuelle nécessaires pour traiter des informations complexes et non factuelles. BoolQ sert ainsi à évaluer la capacité d’un modèle à relier une question au contenu d’un texte, au-delà d’une simple extraction d’information.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle AI Language (Christopher Clark et al.)
Capacités mesuréeslangage, raisonnement
ModalitéTexte
Type de questionsquestions oui/non avec passage de lecture
Métrique d'évaluationaccuracy
AccèsPublic
LicenceCC-BY-SA-3.0
Languesanglais
Taille du jeu15 942 exemples
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Hermes 3 70BNous Research🟢 Ouvert88,0 %15 août 2024Auto-déclaré
2Gemma 2 27BGoogle🟢 Ouvert84,8 %27 juin 2024Auto-déclaré
3Phi-3.5-MoE-instructMicrosoft🟢 Ouvert84,6 %23 août 2024Auto-déclaré
4Gemma 2 9BGoogle🟢 Ouvert84,2 %27 juin 2024Auto-déclaré
5Gemma 3n E4BGoogle🔒 Propriétaire81,6 %26 juin 2025Auto-déclaré
6Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert81,6 %20 mai 2025Auto-déclaré
7Phi 4 MiniMicrosoft🟢 Ouvert81,2 %30 avril 2025Auto-déclaré
8Phi-3.5-mini-instructMicrosoft🟢 Ouvert78,0 %23 août 2024Auto-déclaré
9Gemma 3n E2BGoogle🔒 Propriétaire76,4 %26 juin 2025Auto-déclaré
10Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert76,4 %20 mai 2025Auto-déclaré

Classement établi sur 10 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 81,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé en accuracy indique qu’un modèle répond correctement à une forte proportion de questions booléennes en mobilisant le passage fourni. Il traduit donc une bonne aptitude à la compréhension de lecture et à l’inférence textuelle dans le cadre précis de BoolQ. L’interprétation du classement exige toutefois de la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante uniforme. Avec une médiane de 82 % parmi les dix modèles évalués et un meilleur résultat de 88 % pour Hermes 3 70B de Nous Research, le classement montre des performances globalement élevées et un écart limité entre le niveau médian et la tête. Cette proximité peut réduire le pouvoir discriminant du benchmark et signaler un risque de saturation. Son accès public impose aussi de considérer un possible risque de contamination lors de l’entraînement. Enfin, sa portée reste circonscrite à des questions oui/non en anglais accompagnées d’un passage, et ne résume pas l’ensemble des capacités de raisonnement ou de compréhension d’un modèle.


Sources des scores : llm-stats.