BIG-Bench Extra Hard
BIG-Bench Extra Hard est un benchmark créé par Google DeepMind pour évaluer le raisonnement général difficile et diversifié des modèles d’IA avancés. Il prolonge BIG-Bench Hard en remplaçant chacune de ses tâches par une variante nouvelle et nettement plus exigeante.
BIG-Bench Extra Hard est un benchmark créé par Google DeepMind pour évaluer le raisonnement général difficile et diversifié des modèles d’IA avancés. Il prolonge BIG-Bench Hard en remplaçant chacune de ses tâches par une variante nouvelle et nettement plus exigeante.
Ses tâches couvrent notamment le raisonnement à plusieurs étapes, la causalité, l’espace, le temps, la géométrie, la linguistique, les énigmes logiques et la compréhension de l’humour. Il vise à maintenir un pouvoir discriminant face à la saturation des évaluations existantes, particulièrement en mathématiques et en programmation.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind |
| Capacités mesurées | Raisonnement général difficile et diversifié (au-delà des maths et du code désormais saturés), conçu pour des modèles à raisonnement avancé |
| Modalité | Texte |
| Type de questions | Tâches de raisonnement variées (chaque tâche de BIG-Bench Hard remplacée par une variante nouvelle et nettement plus difficile) |
| Métrique d'évaluation | Accuracy (moyenne harmonique sur les tâches) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 4 520 exemples (version complète) ; 460 (version mini) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemma 4 31B | 🟢 Ouvert | 74,4 % | 2 avril 2026 | Auto-déclaré | |
| 2 | Gemma 4 26B-A4B | 🟢 Ouvert | 64,8 % | 2 avril 2026 | Auto-déclaré | |
| 3 | Gemma 4 12B | 🟢 Ouvert | 53,0 % | 23 mai 2026 | Auto-déclaré | |
| 4 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 47,6 % | 10 juin 2026 | Auto-déclaré | |
| 5 | Gemma 4 E4B | 🟢 Ouvert | 33,1 % | 2 avril 2026 | Auto-déclaré | |
| 6 | Gemma 4 E2B | 🟢 Ouvert | 21,9 % | 2 avril 2026 | Auto-déclaré | |
| 7 | Gemma 3 27B | 🟢 Ouvert | 19,3 % | 12 mars 2025 | Auto-déclaré | |
| 8 | Gemma 3 12B | 🟢 Ouvert | 16,3 % | 12 mars 2025 | Auto-déclaré | |
| 9 | Gemini Diffusion | 🔒 Propriétaire | 15,0 % | 20 mai 2025 | Auto-déclaré | |
| 10 | Gemma 3 4B | 🟢 Ouvert | 11,0 % | 12 mars 2025 | Auto-déclaré | |
| 11 | Gemma 3 1B | 🟢 Ouvert | 7,2 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 11 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 21,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BIG-Bench Extra Hard indique une réussite régulière sur un ensemble varié de problèmes complexes. L’accuracy étant agrégée par moyenne harmonique entre les tâches, une performance équilibrée compte davantage qu’une excellence limitée à quelques catégories. Le benchmark a précisément été conçu pour dépasser la saturation de tests sur lesquels les meilleurs modèles obtenaient des résultats presque parfaits. Sa portée reste toutefois circonscrite à des tâches en anglais et aux formes de raisonnement couvertes par ses 23 catégories.
Dans la base, le score médian de 22 % traduit la difficulté générale du benchmark, tandis que les 74 % de Gemma 4 31B signalent un écart important avec le centre du classement. Cette lecture doit rester prudente: les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que produits dans le cadre d’une mesure indépendante uniforme. Surtout, les 11 modèles classés sont édités par Google, également créateur ou cocréateur du benchmark. Le classement renseigne donc sur les différences internes entre modèles Google, mais ne constitue pas une source indépendante pour les comparer à ceux d’autres éditeurs.
Sources des scores : llm-stats.