WMT24++
WMT24++ est un benchmark de traduction automatique multilingue créé par Google et Unbabel en 2025. Extension de WMT24, il évalue la capacité des systèmes de traduction et des grands modèles de langage à produire des traductions dans des contextes linguistiques variés.
WMT24++ est un benchmark de traduction automatique multilingue créé par Google et Unbabel en 2025. Extension de WMT24, il évalue la capacité des systèmes de traduction et des grands modèles de langage à produire des traductions dans des contextes linguistiques variés.
Son protocole s’appuie sur des références rédigées par des humains et sur des post-éditions, couvrant des contenus littéraires, journalistiques, sociaux et issus de la parole. Des métriques automatiques comme MetricX, COMET et chrF servent à comparer la qualité des productions aux traductions de référence.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google et Unbabel |
| Capacités mesurées | Traduction automatique multilingue couvrant 55 langues et dialectes sur quatre domaines |
| Modalité | Texte |
| Type de questions | traduction automatique (source vers cible) avec references humaines et post-editions |
| Métrique d'évaluation | metriques automatiques de qualite de traduction (ex. MetricX, COMET, chrF) |
| Accès | Public |
| Langues | 55 langues et dialectes |
| Taille du jeu | 55 langues et dialectes, 4 domaines (litteraire, news, social, parole) |
| Année de publication | 2025 |
| Ressources | Article scientifique |
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 86,7 % | 11 mars 2026 | Auto-déclaré |
| 2 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 86,2 % | 15 décembre 2025 | Auto-déclaré |
| 3 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 85,8 % | 19 mai 2026 | Auto-déclaré |
| 4 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 84,6 % | 31 mai 2026 | Auto-déclaré |
| 5 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 84,3 % | 31 mars 2026 | Auto-déclaré |
| 6 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 83,7 % | 4 juin 2026 | Auto-déclaré |
| 7 | Command A+ | Cohere | 🟢 Ouvert | 81,0 % | 20 mai 2026 | Auto-déclaré |
| 8 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,9 % | 16 février 2026 | Auto-déclaré |
| 9 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,3 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,6 % | 24 février 2026 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,3 % | 24 février 2026 | Auto-déclaré |
| 12 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,6 % | 2 mars 2026 | Auto-déclaré |
| 13 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,6 % | 2 mars 2026 | Auto-déclaré |
| 14 | Gemma 3 27B | 🟢 Ouvert | 53,4 % | 12 mars 2025 | Auto-déclaré | |
| 15 | Gemma 3 12B | 🟢 Ouvert | 51,6 % | 12 mars 2025 | Auto-déclaré | |
| 16 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 50,1 % | 26 juin 2025 | Auto-déclaré | |
| 17 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 50,1 % | 20 mai 2025 | Auto-déclaré | |
| 18 | Gemma 3 4B | 🟢 Ouvert | 46,8 % | 12 mars 2025 | Auto-déclaré | |
| 19 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,8 % | 2 mars 2026 | Auto-déclaré |
| 20 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 42,7 % | 26 juin 2025 | Auto-déclaré | |
| 21 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 42,7 % | 20 mai 2025 | Auto-déclaré | |
| 22 | Gemma 3 1B | 🟢 Ouvert | 35,9 % | 12 mars 2025 | Auto-déclaré | |
| 23 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 27,2 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 23 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 72,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur WMT24++ indique une forte concordance avec les références humaines et les post-éditions selon les métriques automatiques retenues. La diversité des langues, dialectes et domaines renforce la portée comparative du benchmark, mais le résultat reste circonscrit à la traduction source vers cible et aux quatre types de contenus couverts. Il ne résume donc pas l’ensemble des capacités d’un modèle.
La présence de références humaines apporte un ancrage qualitatif, tandis que MetricX, COMET et chrF permettent une évaluation reproductible à grande échelle. La fiabilité doit néanmoins être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant unique. Le caractère public du jeu appelle aussi à interpréter prudemment la généralisation, une familiarité avec le benchmark pouvant influencer les résultats. Parmi les 23 modèles évalués, la médiane de 73 % et le meilleur score de 87 %, obtenu par Nemotron 3 Super (120B A12B), montrent une hiérarchie encore différenciée plutôt qu’une saturation complète.
Sources des scores : llm-stats.