Wild Bench

Wild Bench est un cadre d’évaluation automatisé créé en 2024 par l’Allen Institute for AI (AI2). Il s’appuie sur des tâches ouvertes, réalistes et difficiles, sélectionnées à partir de conversations réelles entre des utilisateurs et des chatbots.

Wild Bench est un cadre d’évaluation automatisé créé en 2024 par l’Allen Institute for AI (AI2). Il s’appuie sur des tâches ouvertes, réalistes et difficiles, sélectionnées à partir de conversations réelles entre des utilisateurs et des chatbots.

Le benchmark mesure la capacité des modèles de langage à produire des réponses génératives adaptées dans des domaines comme le raisonnement, la communication, le suivi d’instructions et les usages généraux. Ses listes de critères propres à chaque tâche visent à systématiser l’évaluation, tandis que WB-Score et WB-Reward présentent une forte corrélation avec les préférences humaines.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAllen Institute for AI (AI2)
Capacités mesuréescommunication, généraliste, raisonnement
ModalitéTexte
Type de questionstâches ouvertes issues de conversations réelles utilisateur-chatbot, avec réponses génératives évaluées automatiquement
Métrique d'évaluationWB-Score et WB-Reward
AccèsPublic
Languesprincipalement anglais
Taille du jeu1 024 tâches
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiniStral 3 (14B Instruct 2512)Mistral AI🟢 Ouvert68,5 %4 décembre 2025Auto-déclaré
2Mistral Large 3Mistral AI🟢 Ouvert68,5 %1 septembre 2025Auto-déclaré
3Ministral 3 (8B Instruct 2512)Mistral AI🟢 Ouvert66,8 %4 décembre 2025Auto-déclaré
4Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert65,3 %20 juin 2025Auto-déclaré
5Ministral 3 (3B Instruct 2512)Mistral AI🟢 Ouvert56,8 %4 décembre 2025Auto-déclaré
6Mistral Small 3 24B InstructMistral AI🟢 Ouvert52,2 %30 janvier 2025Auto-déclaré
7Jamba 1.5 LargeAI21 Labs🟢 Ouvert48,5 %22 août 2024Auto-déclaré
8Jamba 1.5 MiniAI21 Labs🟢 Ouvert42,4 %22 août 2024Auto-déclaré

Classement établi sur 8 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 61,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle répond efficacement à un ensemble varié de demandes ouvertes et réalistes, selon les critères spécifiques associés à chaque tâche. Dans la base considérée, MiniStral 3 (14B Instruct 2512) arrive en tête avec 68 %, contre une médiane de 61 % pour les huit modèles évalués. Cet écart modéré suggère un avantage mesurable du premier modèle, sans saturation apparente du benchmark au sommet du classement.

La rigueur de Wild Bench repose sur des listes de contrôle par tâche et sur des métriques automatisées fortement corrélées aux préférences humaines. L’interprétation comparative demande néanmoins de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique. L’accès public peut aussi accroître le risque de contamination au fil de l’utilisation du jeu. Enfin, sa portée reflète surtout des interactions principalement anglophones. Le classement renseigne donc sur les performances relatives face à ces tâches ouvertes, mais ne résume pas à lui seul toutes les capacités générales d’un modèle.


Sources des scores : llm-stats.