AlignBench
AlignBench est un benchmark conçu en 2023 par THUDM, Tsinghua University et plusieurs collaborateurs pour évaluer l’alignement des grands modèles de langage en chinois. Il repose sur des requêtes ouvertes issues de situations réelles, accompagnées de réponses de référence vérifiées par…
AlignBench est un benchmark conçu en 2023 par THUDM, Tsinghua University et plusieurs collaborateurs pour évaluer l’alignement des grands modèles de langage en chinois. Il repose sur des requêtes ouvertes issues de situations réelles, accompagnées de réponses de référence vérifiées par des humains.
Son évaluation couvre notamment la compréhension et la génération en chinois, le raisonnement, les mathématiques, l’écriture, le jeu de rôle et les connaissances professionnelles. AlignBench sert ainsi à comparer la capacité des modèles à produire des réponses pertinentes dans plusieurs dimensions complémentaires.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | THUDM, Tsinghua University et al. |
| Capacités mesurées | créativité, généraliste, langage, mathématiques, raisonnement, jeu de rôle, rédaction |
| Modalité | Texte |
| Type de questions | questions ouvertes et instructions en chinois, avec réponses de référence et évaluation par LLM-as-a-Judge |
| Métrique d'évaluation | score moyen attribué par LLM-as-a-Judge multi-dimensionnel calibré |
| Accès | Public |
| Langues | chinois |
| Taille du jeu | 683 requêtes |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | Qwen2.5 72B Instruct | Qwen | 81,6 % | 19 septembre 2024 | Auto-déclaré |
| 2 | DeepSeek-V2.5 | DeepSeek | 80,4 % | 8 mai 2024 | Auto-déclaré |
| 3 | Qwen2.5 7B Instruct | Qwen | 73,3 % | 19 septembre 2024 | Auto-déclaré |
| 4 | Qwen2 7B Instruct | Qwen | 72,1 % | 23 juillet 2024 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 76,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AlignBench traduit une bonne adéquation aux réponses attendues et aux critères multidimensionnels du juge, sur des tâches chinoises variées. L’évaluation s’appuie sur un LLM-as-a-Judge calibré par des règles, avec raisonnement Chain-of-Thought, ainsi que sur des références vérifiées par des humains. Ce protocole apporte davantage de structure qu’un jugement unique non calibré. La fiabilité pratique du classement reste toutefois à nuancer, car les scores répertoriés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante. Le caractère public du benchmark appelle aussi à considérer un risque de contamination lors de l’entraînement ou de l’optimisation des modèles. Sa portée demeure centrée sur l’alignement en chinois et ne vaut donc pas comme mesure générale dans d’autres langues. Parmi les quatre modèles suivis, Qwen2.5 72B Instruct arrive en tête à 82 %, contre une médiane de 77 %. Cette proximité suggère un pouvoir de séparation limité en haut du classement et invite à surveiller une éventuelle saturation, sans effacer l’avantage observé du modèle Qwen.
Sources des scores : llm-stats.