WMT24++

WMT24++ est un benchmark de traduction automatique multilingue créé par Google et Unbabel en 2025. Extension de WMT24, il évalue la capacité des systèmes de traduction et des grands modèles de langage à produire des traductions dans des contextes linguistiques variés.

WMT24++ est un benchmark de traduction automatique multilingue créé par Google et Unbabel en 2025. Extension de WMT24, il évalue la capacité des systèmes de traduction et des grands modèles de langage à produire des traductions dans des contextes linguistiques variés.

Son protocole s’appuie sur des références rédigées par des humains et sur des post-éditions, couvrant des contenus littéraires, journalistiques, sociaux et issus de la parole. Des métriques automatiques comme MetricX, COMET et chrF servent à comparer la qualité des productions aux traductions de référence.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle et Unbabel
Capacités mesuréesTraduction automatique multilingue couvrant 55 langues et dialectes sur quatre domaines
ModalitéTexte
Type de questionstraduction automatique (source vers cible) avec references humaines et post-editions
Métrique d'évaluationmetriques automatiques de qualite de traduction (ex. MetricX, COMET, chrF)
AccèsPublic
Langues55 langues et dialectes
Taille du jeu55 langues et dialectes, 4 domaines (litteraire, news, social, parole)
Année de publication2025
RessourcesArticle scientifique

Classement des modèles (23)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert86,7 %11 mars 2026Auto-déclaré
2Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert86,2 %15 décembre 2025Auto-déclaré
3Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire85,8 %19 mai 2026Auto-déclaré
4Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire84,6 %31 mai 2026Auto-déclaré
5Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire84,3 %31 mars 2026Auto-déclaré
6Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert83,7 %4 juin 2026Auto-déclaré
7Command A+Cohere🟢 Ouvert81,0 %20 mai 2026Auto-déclaré
8Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert78,9 %16 février 2026Auto-déclaré
9Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert78,3 %24 février 2026Auto-déclaré
10Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert77,6 %24 février 2026Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert76,3 %24 février 2026Auto-déclaré
12Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert72,6 %2 mars 2026Auto-déclaré
13Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert66,6 %2 mars 2026Auto-déclaré
14Gemma 3 27BGoogle🟢 Ouvert53,4 %12 mars 2025Auto-déclaré
15Gemma 3 12BGoogle🟢 Ouvert51,6 %12 mars 2025Auto-déclaré
16Gemma 3n E4B InstructedGoogle🔒 Propriétaire50,1 %26 juin 2025Auto-déclaré
17Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert50,1 %20 mai 2025Auto-déclaré
18Gemma 3 4BGoogle🟢 Ouvert46,8 %12 mars 2025Auto-déclaré
19Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert45,8 %2 mars 2026Auto-déclaré
20Gemma 3n E2B InstructedGoogle🔒 Propriétaire42,7 %26 juin 2025Auto-déclaré
21Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert42,7 %20 mai 2025Auto-déclaré
22Gemma 3 1BGoogle🟢 Ouvert35,9 %12 mars 2025Auto-déclaré
23Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert27,2 %2 mars 2026Auto-déclaré

Classement établi sur 23 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 72,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur WMT24++ indique une forte concordance avec les références humaines et les post-éditions selon les métriques automatiques retenues. La diversité des langues, dialectes et domaines renforce la portée comparative du benchmark, mais le résultat reste circonscrit à la traduction source vers cible et aux quatre types de contenus couverts. Il ne résume donc pas l’ensemble des capacités d’un modèle.

La présence de références humaines apporte un ancrage qualitatif, tandis que MetricX, COMET et chrF permettent une évaluation reproductible à grande échelle. La fiabilité doit néanmoins être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant unique. Le caractère public du jeu appelle aussi à interpréter prudemment la généralisation, une familiarité avec le benchmark pouvant influencer les résultats. Parmi les 23 modèles évalués, la médiane de 73 % et le meilleur score de 87 %, obtenu par Nemotron 3 Super (120B A12B), montrent une hiérarchie encore différenciée plutôt qu’une saturation complète.


Sources des scores : llm-stats.