BBH
BBH, pour Big-Bench Hard, est une suite créée par Mirac Suzgun et ses coauteurs afin d’isoler des tâches de BIG-Bench particulièrement difficiles. Lors des évaluations antérieures, les modèles de langage ne dépassaient pas la moyenne des évaluateurs humains sur ces tâches.
BBH, pour Big-Bench Hard, est une suite créée par Mirac Suzgun et ses coauteurs afin d’isoler des tâches de BIG-Bench particulièrement difficiles. Lors des évaluations antérieures, les modèles de langage ne dépassaient pas la moyenne des évaluateurs humains sur ces tâches.
Le benchmark examine le raisonnement en plusieurs étapes dans des domaines variés, notamment l’arithmétique, la logique, la compréhension du langage, du temps et de l’espace, ainsi que les raisonnements causal et déductif. Il sert ainsi à comparer l’aptitude des modèles à produire une réponse exacte face à des problèmes textuels complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mirac Suzgun et al. |
| Capacités mesurées | langage, mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | tâches textuelles variées, principalement questions à réponse courte ou choix contraint selon la tâche |
| Métrique d'évaluation | accuracy / exact match |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 23 tâches, jusqu’à environ 250 exemples par tâche |
| Année de publication | 2022 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,9 % | 29 avril 2025 | Auto-déclaré |
| 2 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 88,4 % | 27 avril 2026 | Auto-déclaré |
| 3 | Nova Pro | Amazon | 🔒 Propriétaire | 86,9 % | 20 novembre 2024 | Auto-déclaré |
| 4 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,5 % | 19 septembre 2024 | Auto-déclaré |
| 5 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 84,3 % | 8 mai 2024 | Auto-déclaré |
| 6 | Nova Lite | Amazon | 🔒 Propriétaire | 82,4 % | 20 novembre 2024 | Auto-déclaré |
| 7 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,4 % | 23 juillet 2024 | Auto-déclaré |
| 8 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 81,5 % | 11 février 2026 | Auto-déclaré |
| 9 | Nova Micro | Amazon | 🔒 Propriétaire | 79,5 % | 20 novembre 2024 | Auto-déclaré |
| 10 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,2 % | 19 septembre 2024 | Auto-déclaré |
| 11 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 67,8 % | 15 août 2024 | Auto-déclaré |
| 12 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 30,4 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 12 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 82,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BBH indique qu’un modèle résout correctement une large part de tâches exigeant plusieurs étapes de raisonnement. L’accuracy ou l’exact match impose une validation stricte de la réponse finale, sans mesurer directement la qualité des étapes intermédiaires. Dans la base, la médiane de 82 % et le meilleur score de 89 %, obtenu par Qwen3 235B A22B, montrent un niveau global élevé parmi les douze modèles évalués. L’écart limité entre la médiane et la meilleure performance suggère aussi une capacité de différenciation plus réduite dans le haut du classement, compatible avec un début de saturation sur cet ensemble. La portée reste circonscrite à 23 tâches textuelles en anglais, avec au plus environ 250 exemples par tâche. Le caractère public du benchmark peut en outre accroître le risque d’exposition préalable de son contenu. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison est moins rigoureuse qu’une évaluation indépendante conduite selon un protocole commun. Le classement reflète donc surtout la réussite déclarée sur BBH, et non une mesure exhaustive des capacités générales des modèles.
Sources des scores : llm-stats.