OpenBookQA

OpenBookQA est un benchmark conçu en 2018 par l’Allen Institute for AI (AI2) et Todor Mihaylov et al. Inspiré des examens à livre ouvert, il évalue la capacité à répondre à des questions scientifiques élémentaires à choix multiple.

OpenBookQA est un benchmark conçu en 2018 par l’Allen Institute for AI (AI2) et Todor Mihaylov et al. Inspiré des examens à livre ouvert, il évalue la capacité à répondre à des questions scientifiques élémentaires à choix multiple.

Les problèmes mobilisent des faits scientifiques fondamentaux, leur application à des situations nouvelles et leur combinaison avec des connaissances communes. OpenBookQA sert ainsi à mesurer la compréhension factuelle et le raisonnement en plusieurs étapes des modèles, au-delà de la simple restitution d’une information isolée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAllen Institute for AI (AI2) / Todor Mihaylov et al.
Capacités mesuréesgénéraliste, raisonnement
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu5 957 questions
Année de publication2018
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Phi-3.5-MoE-instructMicrosoft🟢 Ouvert89,6 %23 août 2024Auto-déclaré
2Phi 4 MiniMicrosoft🟢 Ouvert79,2 %30 avril 2025Auto-déclaré
3Phi-3.5-mini-instructMicrosoft🟢 Ouvert79,2 %23 août 2024Auto-déclaré
4Mistral NeMo InstructMistral AI🟢 Ouvert60,6 %18 juillet 2024Auto-déclaré
5Hermes 3 70BNous Research🟢 Ouvert49,4 %15 août 2024Auto-déclaré

Classement établi sur 5 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 79,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle sélectionne fréquemment la bonne réponse en combinant des faits scientifiques de base avec des connaissances communes. L’accuracy reste toutefois une mesure de résultat sur des QCM en anglais portant sur les sciences au niveau élémentaire. Elle ne couvre donc pas l’ensemble des capacités scientifiques, linguistiques ou de raisonnement d’un modèle.

Dans la base, cinq modèles sont évalués et le score médian atteint 79 %. Phi-3.5-MoE-instruct de Microsoft arrive en tête avec 90 %, ce qui révèle un avantage net sur le résultat médian. Ce niveau élevé réduit aussi la marge restante sur le benchmark et peut signaler une progression vers la saturation pour les meilleurs systèmes. La plupart des scores étant auto-déclarés par les éditeurs, leur comparaison est moins rigoureuse qu’une évaluation indépendante conduite dans un cadre uniformisé. Enfin, l’accès public au jeu impose de considérer le risque de contamination lors de l’interprétation des performances, sans qu’un score élevé suffise à distinguer mémorisation et raisonnement.


Sources des scores : llm-stats.