BoolQ
BoolQ est un benchmark de compréhension de lecture créé par Google AI Language, sous la direction de Christopher Clark et ses coauteurs. Il repose sur des questions naturelles auxquelles un modèle doit répondre par oui ou non en s’appuyant sur un passage.
BoolQ est un benchmark de compréhension de lecture créé par Google AI Language, sous la direction de Christopher Clark et ses coauteurs. Il repose sur des questions naturelles auxquelles un modèle doit répondre par oui ou non en s’appuyant sur un passage.
Son intérêt tient aux inférences proches de l’implication textuelle nécessaires pour traiter des informations complexes et non factuelles. BoolQ sert ainsi à évaluer la capacité d’un modèle à relier une question au contenu d’un texte, au-delà d’une simple extraction d’information.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google AI Language (Christopher Clark et al.) |
| Capacités mesurées | langage, raisonnement |
| Modalité | Texte |
| Type de questions | questions oui/non avec passage de lecture |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | CC-BY-SA-3.0 |
| Langues | anglais |
| Taille du jeu | 15 942 exemples |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 88,0 % | 15 août 2024 | Auto-déclaré |
| 2 | Gemma 2 27B | 🟢 Ouvert | 84,8 % | 27 juin 2024 | Auto-déclaré | |
| 3 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 84,6 % | 23 août 2024 | Auto-déclaré |
| 4 | Gemma 2 9B | 🟢 Ouvert | 84,2 % | 27 juin 2024 | Auto-déclaré | |
| 5 | Gemma 3n E4B | 🔒 Propriétaire | 81,6 % | 26 juin 2025 | Auto-déclaré | |
| 6 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 81,6 % | 20 mai 2025 | Auto-déclaré | |
| 7 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 81,2 % | 30 avril 2025 | Auto-déclaré |
| 8 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 78,0 % | 23 août 2024 | Auto-déclaré |
| 9 | Gemma 3n E2B | 🔒 Propriétaire | 76,4 % | 26 juin 2025 | Auto-déclaré | |
| 10 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 76,4 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 81,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé en accuracy indique qu’un modèle répond correctement à une forte proportion de questions booléennes en mobilisant le passage fourni. Il traduit donc une bonne aptitude à la compréhension de lecture et à l’inférence textuelle dans le cadre précis de BoolQ. L’interprétation du classement exige toutefois de la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante uniforme. Avec une médiane de 82 % parmi les dix modèles évalués et un meilleur résultat de 88 % pour Hermes 3 70B de Nous Research, le classement montre des performances globalement élevées et un écart limité entre le niveau médian et la tête. Cette proximité peut réduire le pouvoir discriminant du benchmark et signaler un risque de saturation. Son accès public impose aussi de considérer un possible risque de contamination lors de l’entraînement. Enfin, sa portée reste circonscrite à des questions oui/non en anglais accompagnées d’un passage, et ne résume pas l’ensemble des capacités de raisonnement ou de compréhension d’un modèle.
Sources des scores : llm-stats.