BIG-Bench Hard
BIG-Bench Hard, créé par M. Suzgun et al. en 2022, rassemble des tâches de BIG-Bench sélectionnées parce que les évaluations antérieures de modèles de langage n’y dépassaient pas la performance moyenne d’évaluateurs humains.
BIG-Bench Hard, créé par M. Suzgun et al. en 2022, rassemble des tâches de BIG-Bench sélectionnées parce que les évaluations antérieures de modèles de langage n’y dépassaient pas la performance moyenne d’évaluateurs humains.
Le benchmark mesure différentes formes de raisonnement multi-étapes en langage naturel, notamment arithmétiques, logiques, symboliques, temporelles et spatiales. Ses questions textuelles couvrent aussi la compréhension de consignes complexes, le jugement causal, le comptage, la navigation et la reconnaissance de motifs. Il sert ainsi à comparer l’aptitude des modèles à résoudre des problèmes complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | M. Suzgun et al. |
| Capacités mesurées | langage, mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions textuelles à réponse courte, avec formats variables selon les tâches |
| Métrique d'évaluation | exact match / accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 6 511 exemples répartis sur 23 tâches |
| Année de publication | 2022 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (20)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 93,1 % | 22 octobre 2024 | Auto-déclaré |
| 2 | Gemini 1.5 Pro | 🔒 Propriétaire | 89,2 % | 1 mai 2024 | Auto-déclaré | |
| 3 | Gemma 3 27B | 🟢 Ouvert | 87,6 % | 12 mars 2025 | Auto-déclaré | |
| 4 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 86,8 % | 29 février 2024 | Auto-déclaré |
| 5 | Gemma 3 12B | 🟢 Ouvert | 85,7 % | 12 mars 2025 | Auto-déclaré | |
| 6 | Gemini 1.5 Flash | 🔒 Propriétaire | 85,5 % | 1 mai 2024 | Auto-déclaré | |
| 7 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 82,9 % | 29 février 2024 | Auto-déclaré |
| 8 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 79,1 % | 23 août 2024 | Auto-déclaré |
| 9 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 73,7 % | 13 mars 2024 | Auto-déclaré |
| 10 | Gemma 3 4B | 🟢 Ouvert | 72,2 % | 12 mars 2025 | Auto-déclaré | |
| 11 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 70,4 % | 30 avril 2025 | Auto-déclaré |
| 12 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 69,1 % | 16 avril 2025 | Auto-déclaré |
| 13 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 69,1 % | 16 avril 2025 | Auto-déclaré |
| 14 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 69,0 % | 23 août 2024 | Auto-déclaré |
| 15 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 55,7 % | 2 mai 2025 | Auto-déclaré |
| 16 | Gemma 3n E4B | 🔒 Propriétaire | 52,9 % | 26 juin 2025 | Auto-déclaré | |
| 17 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 52,9 % | 20 mai 2025 | Auto-déclaré | |
| 18 | Gemma 3n E2B | 🔒 Propriétaire | 44,3 % | 26 juin 2025 | Auto-déclaré | |
| 19 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 44,3 % | 20 mai 2025 | Auto-déclaré | |
| 20 | Gemma 3 1B | 🟢 Ouvert | 39,1 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 20 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 71,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BIG-Bench Hard indique qu’un modèle produit fréquemment la réponse courte exacte attendue sur un éventail de tâches exigeant plusieurs étapes de raisonnement. La métrique exact match / accuracy impose une correspondance stricte, mais ne renseigne pas directement sur la qualité du cheminement ayant conduit à la réponse. La fiabilité comparative doit aussi être nuancée, puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.
Le classement fait apparaître un niveau médian de 71 %, tandis que Claude 3.5 Sonnet atteint 93 %. Cet écart montre qu’une différenciation subsiste entre les modèles, même si un meilleur score proche du maximum peut signaler un risque de saturation progressive. La portée reste circonscrite à 23 tâches en anglais, choisies pour leur difficulté historique, et ne représente donc pas toutes les capacités d’un modèle. Enfin, l’accès public au jeu peut accroître le risque de contamination des évaluations, ce qui invite à interpréter les performances avec prudence.
Sources des scores : llm-stats.