WMT23

WMT23 est un benchmark de traduction automatique créé en 2023 par la Conference on Machine Translation (WMT). Il évalue des systèmes dans plusieurs domaines, notamment la traduction générale, biomédicale et littéraire, ainsi que pour des langues peu dotées.

WMT23 est un benchmark de traduction automatique créé en 2023 par la Conference on Machine Translation (WMT). Il évalue des systèmes dans plusieurs domaines, notamment la traduction générale, biomédicale et littéraire, ainsi que pour des langues peu dotées.

Son protocole associe évaluation humaine professionnelle et métriques automatiques comme BLEU et COMET. Il sert à comparer la qualité des traductions selon différentes directions linguistiques, tout en intégrant des tâches spécialisées portant sur l’estimation de qualité, l’évaluation des métriques, la langue des signes et la traduction littéraire au niveau du discours.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkConference on Machine Translation (WMT)
Capacités mesuréesÉvaluation de systèmes de traduction automatique sur plusieurs domaines (général, biomédical, littéraire) et directions de langues
ModalitéTexte
Type de questionstraduction automatique
Métrique d'évaluationévaluation humaine + métriques automatiques (BLEU, COMET, etc.)
AccèsPublic
Languesmultilingue (général, biomédical, littéraire, langues peu dotées)
Taille du jeu8 paires de langues (14 directions de traduction)
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 1.5 ProGoogle🔒 Propriétaire75,1 %1 mai 2024Auto-déclaré
2Gemini 1.5 FlashGoogle🔒 Propriétaire74,1 %1 mai 2024Auto-déclaré
3Gemini 1.5 Flash 8BGoogle🔒 Propriétaire72,6 %15 mars 2024Auto-déclaré
4Gemini 1.0 ProGoogle🔒 Propriétaire71,7 %15 février 2024n.d.

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 73,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur WMT23 indique de bonnes performances en traduction automatique au regard des évaluations humaines et des métriques retenues. Il doit être interprété dans le périmètre du benchmark, centré sur la traduction et sur ses domaines et directions linguistiques, plutôt que comme une mesure générale des capacités d’un modèle.

La combinaison de jugements humains professionnels et d’indicateurs automatiques renforce la diversité de l’évaluation. Dans la base considérée, la fiabilité reste toutefois à nuancer, car les résultats sont majoritairement auto-déclarés par les éditeurs. Le caractère public du benchmark appelle également à la prudence face au risque de contamination. Avec quatre modèles évalués, un score médian de 73 % et Gemini 1.5 Pro en tête à 75 %, le classement montre des performances rapprochées. Ce faible écart peut limiter le pouvoir discriminant du classement et évoquer une forme de saturation parmi les modèles recensés, sans effacer l’intérêt des analyses par domaine, direction de traduction et méthode d’évaluation.


Sources des scores : llm-stats.