NOVA-63
NOVA-63 est un benchmark d’évaluation multilingue conçu par Jinyang Zhang et ses coauteurs de l’Université de Pékin et d’Alibaba Group. Il repose sur des questions rédigées directement par des locuteurs natifs, afin d’éviter les formulations artificielles issues de traductions.
NOVA-63 est un benchmark d’évaluation multilingue conçu par Jinyang Zhang et ses coauteurs de l’Université de Pékin et d’Alibaba Group. Il repose sur des questions rédigées directement par des locuteurs natifs, afin d’éviter les formulations artificielles issues de traductions.
Le benchmark mesure les capacités des grands modèles de langage dans des contextes linguistiques variés et à travers 63 disciplines académiques. Le contrôle de la difficulté vise à rendre les résultats comparables et à mieux distinguer les performances des modèles sur des connaissances et tâches diversifiées.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Jinyang Zhang et al. (Université de Pékin & Alibaba Group) |
| Capacités mesurées | Évalue les capacités multilingues des LLM via des questions rédigées par des locuteurs natifs (sans translationese) couvrant 63 disciplines académiques, avec contrôle de difficulté. |
| Modalité | Texte |
| Accès | Public |
| Licence | MIT (jeu de données Hugging Face) ; texte du papier sous CC BY 4.0 |
| Langues | 14 langues (dont arabe, chinois, anglais) |
| Taille du jeu | 93 536 questions |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,1 % | 16 février 2026 | Auto-déclaré |
| 2 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 59,0 % | 19 mai 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 58,8 % | 31 mai 2026 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,6 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,1 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 57,9 % | 31 mars 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,1 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,9 % | 2 mars 2026 | Auto-déclaré |
| 9 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,3 % | 2 mars 2026 | Auto-déclaré |
| 10 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,4 % | 2 mars 2026 | Auto-déclaré |
| 11 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 42,4 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 57,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur NOVA-63 indique une meilleure capacité à traiter des questions multilingues rédigées naturellement, dans un large éventail de disciplines et avec une difficulté contrôlée. Dans la base, l’écart entre le meilleur résultat, obtenu par Qwen3.5-397B-A17B, et le score médian n’est que d’un point. Cette faible dispersion limite le pouvoir discriminant du classement à son sommet et peut signaler une forme de saturation parmi les modèles évalués.
La lecture des résultats exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un cadre indépendant et uniforme. La portée comparative est également restreinte par la composition du classement : les onze modèles présents sont édités par Qwen, qui a aussi codéveloppé NOVA-63. Le leaderboard renseigne donc surtout sur les écarts internes à cette gamme. Il ne constitue pas une source indépendante pour comparer les modèles Qwen à ceux d’autres éditeurs. La rédaction native des questions réduit le biais lié au translationese, sans changer cette limite structurelle du classement.
Sources des scores : llm-stats.