Wild Bench
Wild Bench est un cadre d’évaluation automatisé créé en 2024 par l’Allen Institute for AI (AI2). Il s’appuie sur des tâches ouvertes, réalistes et difficiles, sélectionnées à partir de conversations réelles entre des utilisateurs et des chatbots.
Wild Bench est un cadre d’évaluation automatisé créé en 2024 par l’Allen Institute for AI (AI2). Il s’appuie sur des tâches ouvertes, réalistes et difficiles, sélectionnées à partir de conversations réelles entre des utilisateurs et des chatbots.
Le benchmark mesure la capacité des modèles de langage à produire des réponses génératives adaptées dans des domaines comme le raisonnement, la communication, le suivi d’instructions et les usages généraux. Ses listes de critères propres à chaque tâche visent à systématiser l’évaluation, tandis que WB-Score et WB-Reward présentent une forte corrélation avec les préférences humaines.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Allen Institute for AI (AI2) |
| Capacités mesurées | communication, généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | tâches ouvertes issues de conversations réelles utilisateur-chatbot, avec réponses génératives évaluées automatiquement |
| Métrique d'évaluation | WB-Score et WB-Reward |
| Accès | Public |
| Langues | principalement anglais |
| Taille du jeu | 1 024 tâches |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiniStral 3 (14B Instruct 2512) | Mistral AI | 🟢 Ouvert | 68,5 % | 4 décembre 2025 | Auto-déclaré |
| 2 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 68,5 % | 1 septembre 2025 | Auto-déclaré |
| 3 | Ministral 3 (8B Instruct 2512) | Mistral AI | 🟢 Ouvert | 66,8 % | 4 décembre 2025 | Auto-déclaré |
| 4 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 65,3 % | 20 juin 2025 | Auto-déclaré |
| 5 | Ministral 3 (3B Instruct 2512) | Mistral AI | 🟢 Ouvert | 56,8 % | 4 décembre 2025 | Auto-déclaré |
| 6 | Mistral Small 3 24B Instruct | Mistral AI | 🟢 Ouvert | 52,2 % | 30 janvier 2025 | Auto-déclaré |
| 7 | Jamba 1.5 Large | AI21 Labs | 🟢 Ouvert | 48,5 % | 22 août 2024 | Auto-déclaré |
| 8 | Jamba 1.5 Mini | AI21 Labs | 🟢 Ouvert | 42,4 % | 22 août 2024 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 61,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle répond efficacement à un ensemble varié de demandes ouvertes et réalistes, selon les critères spécifiques associés à chaque tâche. Dans la base considérée, MiniStral 3 (14B Instruct 2512) arrive en tête avec 68 %, contre une médiane de 61 % pour les huit modèles évalués. Cet écart modéré suggère un avantage mesurable du premier modèle, sans saturation apparente du benchmark au sommet du classement.
La rigueur de Wild Bench repose sur des listes de contrôle par tâche et sur des métriques automatisées fortement corrélées aux préférences humaines. L’interprétation comparative demande néanmoins de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique. L’accès public peut aussi accroître le risque de contamination au fil de l’utilisation du jeu. Enfin, sa portée reflète surtout des interactions principalement anglophones. Le classement renseigne donc sur les performances relatives face à ces tâches ouvertes, mais ne résume pas à lui seul toutes les capacités générales d’un modèle.
Sources des scores : llm-stats.