BBH

BBH, pour Big-Bench Hard, est une suite créée par Mirac Suzgun et ses coauteurs afin d’isoler des tâches de BIG-Bench particulièrement difficiles. Lors des évaluations antérieures, les modèles de langage ne dépassaient pas la moyenne des évaluateurs humains sur ces tâches.

BBH, pour Big-Bench Hard, est une suite créée par Mirac Suzgun et ses coauteurs afin d’isoler des tâches de BIG-Bench particulièrement difficiles. Lors des évaluations antérieures, les modèles de langage ne dépassaient pas la moyenne des évaluateurs humains sur ces tâches.

Le benchmark examine le raisonnement en plusieurs étapes dans des domaines variés, notamment l’arithmétique, la logique, la compréhension du langage, du temps et de l’espace, ainsi que les raisonnements causal et déductif. Il sert ainsi à comparer l’aptitude des modèles à produire une réponse exacte face à des problèmes textuels complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMirac Suzgun et al.
Capacités mesuréeslangage, mathématiques, raisonnement
ModalitéTexte
Type de questionstâches textuelles variées, principalement questions à réponse courte ou choix contraint selon la tâche
Métrique d'évaluationaccuracy / exact match
AccèsPublic
Languesanglais
Taille du jeu23 tâches, jusqu’à environ 250 exemples par tâche
Année de publication2022
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert88,9 %29 avril 2025Auto-déclaré
2MiMo-V2.5-ProXiaomi🟢 Ouvert88,4 %27 avril 2026Auto-déclaré
3Nova ProAmazon🔒 Propriétaire86,9 %20 novembre 2024Auto-déclaré
4Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,5 %19 septembre 2024Auto-déclaré
5DeepSeek-V2.5DeepSeek🟢 Ouvert84,3 %8 mai 2024Auto-déclaré
6Nova LiteAmazon🔒 Propriétaire82,4 %20 novembre 2024Auto-déclaré
7Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,4 %23 juillet 2024Auto-déclaré
8MiniCPM-SALAOpenBMB🟢 Ouvert81,5 %11 février 2026Auto-déclaré
9Nova MicroAmazon🔒 Propriétaire79,5 %20 novembre 2024Auto-déclaré
10Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert78,2 %19 septembre 2024Auto-déclaré
11Hermes 3 70BNous Research🟢 Ouvert67,8 %15 août 2024Auto-déclaré
12ERNIE 4.5Baidu🔒 Propriétaire30,4 %25 juin 2025Auto-déclaré

Classement établi sur 12 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 82,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BBH indique qu’un modèle résout correctement une large part de tâches exigeant plusieurs étapes de raisonnement. L’accuracy ou l’exact match impose une validation stricte de la réponse finale, sans mesurer directement la qualité des étapes intermédiaires. Dans la base, la médiane de 82 % et le meilleur score de 89 %, obtenu par Qwen3 235B A22B, montrent un niveau global élevé parmi les douze modèles évalués. L’écart limité entre la médiane et la meilleure performance suggère aussi une capacité de différenciation plus réduite dans le haut du classement, compatible avec un début de saturation sur cet ensemble. La portée reste circonscrite à 23 tâches textuelles en anglais, avec au plus environ 250 exemples par tâche. Le caractère public du benchmark peut en outre accroître le risque d’exposition préalable de son contenu. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison est moins rigoureuse qu’une évaluation indépendante conduite selon un protocole commun. Le classement reflète donc surtout la réussite déclarée sur BBH, et non une mesure exhaustive des capacités générales des modèles.


Sources des scores : llm-stats.