BIG-Bench Hard

BIG-Bench Hard, créé par M. Suzgun et al. en 2022, rassemble des tâches de BIG-Bench sélectionnées parce que les évaluations antérieures de modèles de langage n’y dépassaient pas la performance moyenne d’évaluateurs humains.

BIG-Bench Hard, créé par M. Suzgun et al. en 2022, rassemble des tâches de BIG-Bench sélectionnées parce que les évaluations antérieures de modèles de langage n’y dépassaient pas la performance moyenne d’évaluateurs humains.

Le benchmark mesure différentes formes de raisonnement multi-étapes en langage naturel, notamment arithmétiques, logiques, symboliques, temporelles et spatiales. Ses questions textuelles couvrent aussi la compréhension de consignes complexes, le jugement causal, le comptage, la navigation et la reconnaissance de motifs. Il sert ainsi à comparer l’aptitude des modèles à résoudre des problèmes complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkM. Suzgun et al.
Capacités mesuréeslangage, mathématiques, raisonnement
ModalitéTexte
Type de questionsquestions textuelles à réponse courte, avec formats variables selon les tâches
Métrique d'évaluationexact match / accuracy
AccèsPublic
Languesanglais
Taille du jeu6 511 exemples répartis sur 23 tâches
Année de publication2022
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (20)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude 3.5 SonnetAnthropic🔒 Propriétaire93,1 %22 octobre 2024Auto-déclaré
2Gemini 1.5 ProGoogle🔒 Propriétaire89,2 %1 mai 2024Auto-déclaré
3Gemma 3 27BGoogle🟢 Ouvert87,6 %12 mars 2025Auto-déclaré
4Claude 3 OpusAnthropic🔒 Propriétaire86,8 %29 février 2024Auto-déclaré
5Gemma 3 12BGoogle🟢 Ouvert85,7 %12 mars 2025Auto-déclaré
6Gemini 1.5 FlashGoogle🔒 Propriétaire85,5 %1 mai 2024Auto-déclaré
7Claude 3 SonnetAnthropic🔒 Propriétaire82,9 %29 février 2024Auto-déclaré
8Phi-3.5-MoE-instructMicrosoft🟢 Ouvert79,1 %23 août 2024Auto-déclaré
9Claude 3 HaikuAnthropic🔒 Propriétaire73,7 %13 mars 2024Auto-déclaré
10Gemma 3 4BGoogle🟢 Ouvert72,2 %12 mars 2025Auto-déclaré
11Phi 4 MiniMicrosoft🟢 Ouvert70,4 %30 avril 2025Auto-déclaré
12Granite 3.3 8B BaseIBM🟢 Ouvert69,1 %16 avril 2025Auto-déclaré
13Granite 3.3 8B InstructIBM🟢 Ouvert69,1 %16 avril 2025Auto-déclaré
14Phi-3.5-mini-instructMicrosoft🟢 Ouvert69,0 %23 août 2024Auto-déclaré
15IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert55,7 %2 mai 2025Auto-déclaré
16Gemma 3n E4BGoogle🔒 Propriétaire52,9 %26 juin 2025Auto-déclaré
17Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert52,9 %20 mai 2025Auto-déclaré
18Gemma 3n E2BGoogle🔒 Propriétaire44,3 %26 juin 2025Auto-déclaré
19Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert44,3 %20 mai 2025Auto-déclaré
20Gemma 3 1BGoogle🟢 Ouvert39,1 %12 mars 2025Auto-déclaré

Classement établi sur 20 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 71,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BIG-Bench Hard indique qu’un modèle produit fréquemment la réponse courte exacte attendue sur un éventail de tâches exigeant plusieurs étapes de raisonnement. La métrique exact match / accuracy impose une correspondance stricte, mais ne renseigne pas directement sur la qualité du cheminement ayant conduit à la réponse. La fiabilité comparative doit aussi être nuancée, puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.

Le classement fait apparaître un niveau médian de 71 %, tandis que Claude 3.5 Sonnet atteint 93 %. Cet écart montre qu’une différenciation subsiste entre les modèles, même si un meilleur score proche du maximum peut signaler un risque de saturation progressive. La portée reste circonscrite à 23 tâches en anglais, choisies pour leur difficulté historique, et ne représente donc pas toutes les capacités d’un modèle. Enfin, l’accès public au jeu peut accroître le risque de contamination des évaluations, ce qui invite à interpréter les performances avec prudence.


Sources des scores : llm-stats.