AlignBench

AlignBench est un benchmark conçu en 2023 par THUDM, Tsinghua University et plusieurs collaborateurs pour évaluer l’alignement des grands modèles de langage en chinois. Il repose sur des requêtes ouvertes issues de situations réelles, accompagnées de réponses de référence vérifiées par…

AlignBench est un benchmark conçu en 2023 par THUDM, Tsinghua University et plusieurs collaborateurs pour évaluer l’alignement des grands modèles de langage en chinois. Il repose sur des requêtes ouvertes issues de situations réelles, accompagnées de réponses de référence vérifiées par des humains.

Son évaluation couvre notamment la compréhension et la génération en chinois, le raisonnement, les mathématiques, l’écriture, le jeu de rôle et les connaissances professionnelles. AlignBench sert ainsi à comparer la capacité des modèles à produire des réponses pertinentes dans plusieurs dimensions complémentaires.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkTHUDM, Tsinghua University et al.
Capacités mesuréescréativité, généraliste, langage, mathématiques, raisonnement, jeu de rôle, rédaction
ModalitéTexte
Type de questionsquestions ouvertes et instructions en chinois, avec réponses de référence et évaluation par LLM-as-a-Judge
Métrique d'évaluationscore moyen attribué par LLM-as-a-Judge multi-dimensionnel calibré
AccèsPublic
Langueschinois
Taille du jeu683 requêtes
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1Qwen2.5 72B InstructQwen81,6 %19 septembre 2024Auto-déclaré
2DeepSeek-V2.5DeepSeek80,4 %8 mai 2024Auto-déclaré
3Qwen2.5 7B InstructQwen73,3 %19 septembre 2024Auto-déclaré
4Qwen2 7B InstructQwen72,1 %23 juillet 2024Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 76,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur AlignBench traduit une bonne adéquation aux réponses attendues et aux critères multidimensionnels du juge, sur des tâches chinoises variées. L’évaluation s’appuie sur un LLM-as-a-Judge calibré par des règles, avec raisonnement Chain-of-Thought, ainsi que sur des références vérifiées par des humains. Ce protocole apporte davantage de structure qu’un jugement unique non calibré. La fiabilité pratique du classement reste toutefois à nuancer, car les scores répertoriés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante. Le caractère public du benchmark appelle aussi à considérer un risque de contamination lors de l’entraînement ou de l’optimisation des modèles. Sa portée demeure centrée sur l’alignement en chinois et ne vaut donc pas comme mesure générale dans d’autres langues. Parmi les quatre modèles suivis, Qwen2.5 72B Instruct arrive en tête à 82 %, contre une médiane de 77 %. Cette proximité suggère un pouvoir de séparation limité en haut du classement et invite à surveiller une éventuelle saturation, sans effacer l’avantage observé du modèle Qwen.


Sources des scores : llm-stats.