NOVA-63

NOVA-63 est un benchmark d’évaluation multilingue conçu par Jinyang Zhang et ses coauteurs de l’Université de Pékin et d’Alibaba Group. Il repose sur des questions rédigées directement par des locuteurs natifs, afin d’éviter les formulations artificielles issues de traductions.

NOVA-63 est un benchmark d’évaluation multilingue conçu par Jinyang Zhang et ses coauteurs de l’Université de Pékin et d’Alibaba Group. Il repose sur des questions rédigées directement par des locuteurs natifs, afin d’éviter les formulations artificielles issues de traductions.

Le benchmark mesure les capacités des grands modèles de langage dans des contextes linguistiques variés et à travers 63 disciplines académiques. Le contrôle de la difficulté vise à rendre les résultats comparables et à mieux distinguer les performances des modèles sur des connaissances et tâches diversifiées.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkJinyang Zhang et al. (Université de Pékin & Alibaba Group)
Capacités mesuréesÉvalue les capacités multilingues des LLM via des questions rédigées par des locuteurs natifs (sans translationese) couvrant 63 disciplines académiques, avec contrôle de difficulté.
ModalitéTexte
AccèsPublic
LicenceMIT (jeu de données Hugging Face) ; texte du papier sous CC BY 4.0
Langues14 langues (dont arabe, chinois, anglais)
Taille du jeu93 536 questions
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert59,1 %16 février 2026Auto-déclaré
2Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire59,0 %19 mai 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire58,8 %31 mai 2026Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert58,6 %24 février 2026Auto-déclaré
5Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert58,1 %24 février 2026Auto-déclaré
6Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire57,9 %31 mars 2026Auto-déclaré
7Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert57,1 %24 février 2026Auto-déclaré
8Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert55,9 %2 mars 2026Auto-déclaré
9Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert54,3 %2 mars 2026Auto-déclaré
10Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert46,4 %2 mars 2026Auto-déclaré
11Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert42,4 %2 mars 2026Auto-déclaré

Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 57,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur NOVA-63 indique une meilleure capacité à traiter des questions multilingues rédigées naturellement, dans un large éventail de disciplines et avec une difficulté contrôlée. Dans la base, l’écart entre le meilleur résultat, obtenu par Qwen3.5-397B-A17B, et le score médian n’est que d’un point. Cette faible dispersion limite le pouvoir discriminant du classement à son sommet et peut signaler une forme de saturation parmi les modèles évalués.

La lecture des résultats exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un cadre indépendant et uniforme. La portée comparative est également restreinte par la composition du classement : les onze modèles présents sont édités par Qwen, qui a aussi codéveloppé NOVA-63. Le leaderboard renseigne donc surtout sur les écarts internes à cette gamme. Il ne constitue pas une source indépendante pour comparer les modèles Qwen à ceux d’autres éditeurs. La rédaction native des questions réduit le biais lié au translationese, sans changer cette limite structurelle du classement.


Sources des scores : llm-stats.