BIG-Bench Extra Hard

BIG-Bench Extra Hard est un benchmark créé par Google DeepMind pour évaluer le raisonnement général difficile et diversifié des modèles d’IA avancés. Il prolonge BIG-Bench Hard en remplaçant chacune de ses tâches par une variante nouvelle et nettement plus exigeante.

BIG-Bench Extra Hard est un benchmark créé par Google DeepMind pour évaluer le raisonnement général difficile et diversifié des modèles d’IA avancés. Il prolonge BIG-Bench Hard en remplaçant chacune de ses tâches par une variante nouvelle et nettement plus exigeante.

Ses tâches couvrent notamment le raisonnement à plusieurs étapes, la causalité, l’espace, le temps, la géométrie, la linguistique, les énigmes logiques et la compréhension de l’humour. Il vise à maintenir un pouvoir discriminant face à la saturation des évaluations existantes, particulièrement en mathématiques et en programmation.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind
Capacités mesuréesRaisonnement général difficile et diversifié (au-delà des maths et du code désormais saturés), conçu pour des modèles à raisonnement avancé
ModalitéTexte
Type de questionsTâches de raisonnement variées (chaque tâche de BIG-Bench Hard remplacée par une variante nouvelle et nettement plus difficile)
Métrique d'évaluationAccuracy (moyenne harmonique sur les tâches)
AccèsPublic
LanguesAnglais
Taille du jeu4 520 exemples (version complète) ; 460 (version mini)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemma 4 31BGoogle🟢 Ouvert74,4 %2 avril 2026Auto-déclaré
2Gemma 4 26B-A4BGoogle🟢 Ouvert64,8 %2 avril 2026Auto-déclaré
3Gemma 4 12BGoogle🟢 Ouvert53,0 %23 mai 2026Auto-déclaré
4DiffusionGemma 26B-A4BGoogle🟢 Ouvert47,6 %10 juin 2026Auto-déclaré
5Gemma 4 E4BGoogle🟢 Ouvert33,1 %2 avril 2026Auto-déclaré
6Gemma 4 E2BGoogle🟢 Ouvert21,9 %2 avril 2026Auto-déclaré
7Gemma 3 27BGoogle🟢 Ouvert19,3 %12 mars 2025Auto-déclaré
8Gemma 3 12BGoogle🟢 Ouvert16,3 %12 mars 2025Auto-déclaré
9Gemini DiffusionGoogle🔒 Propriétaire15,0 %20 mai 2025Auto-déclaré
10Gemma 3 4BGoogle🟢 Ouvert11,0 %12 mars 2025Auto-déclaré
11Gemma 3 1BGoogle🟢 Ouvert7,2 %12 mars 2025Auto-déclaré

Classement établi sur 11 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 21,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BIG-Bench Extra Hard indique une réussite régulière sur un ensemble varié de problèmes complexes. L’accuracy étant agrégée par moyenne harmonique entre les tâches, une performance équilibrée compte davantage qu’une excellence limitée à quelques catégories. Le benchmark a précisément été conçu pour dépasser la saturation de tests sur lesquels les meilleurs modèles obtenaient des résultats presque parfaits. Sa portée reste toutefois circonscrite à des tâches en anglais et aux formes de raisonnement couvertes par ses 23 catégories.

Dans la base, le score médian de 22 % traduit la difficulté générale du benchmark, tandis que les 74 % de Gemma 4 31B signalent un écart important avec le centre du classement. Cette lecture doit rester prudente: les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que produits dans le cadre d’une mesure indépendante uniforme. Surtout, les 11 modèles classés sont édités par Google, également créateur ou cocréateur du benchmark. Le classement renseigne donc sur les différences internes entre modèles Google, mais ne constitue pas une source indépendante pour les comparer à ceux d’autres éditeurs.


Sources des scores : llm-stats.