WMT23
WMT23 est un benchmark de traduction automatique créé en 2023 par la Conference on Machine Translation (WMT). Il évalue des systèmes dans plusieurs domaines, notamment la traduction générale, biomédicale et littéraire, ainsi que pour des langues peu dotées.
WMT23 est un benchmark de traduction automatique créé en 2023 par la Conference on Machine Translation (WMT). Il évalue des systèmes dans plusieurs domaines, notamment la traduction générale, biomédicale et littéraire, ainsi que pour des langues peu dotées.
Son protocole associe évaluation humaine professionnelle et métriques automatiques comme BLEU et COMET. Il sert à comparer la qualité des traductions selon différentes directions linguistiques, tout en intégrant des tâches spécialisées portant sur l’estimation de qualité, l’évaluation des métriques, la langue des signes et la traduction littéraire au niveau du discours.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Conference on Machine Translation (WMT) |
| Capacités mesurées | Évaluation de systèmes de traduction automatique sur plusieurs domaines (général, biomédical, littéraire) et directions de langues |
| Modalité | Texte |
| Type de questions | traduction automatique |
| Métrique d'évaluation | évaluation humaine + métriques automatiques (BLEU, COMET, etc.) |
| Accès | Public |
| Langues | multilingue (général, biomédical, littéraire, langues peu dotées) |
| Taille du jeu | 8 paires de langues (14 directions de traduction) |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 1.5 Pro | 🔒 Propriétaire | 75,1 % | 1 mai 2024 | Auto-déclaré | |
| 2 | Gemini 1.5 Flash | 🔒 Propriétaire | 74,1 % | 1 mai 2024 | Auto-déclaré | |
| 3 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 72,6 % | 15 mars 2024 | Auto-déclaré | |
| 4 | Gemini 1.0 Pro | 🔒 Propriétaire | 71,7 % | 15 février 2024 | n.d. |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 73,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur WMT23 indique de bonnes performances en traduction automatique au regard des évaluations humaines et des métriques retenues. Il doit être interprété dans le périmètre du benchmark, centré sur la traduction et sur ses domaines et directions linguistiques, plutôt que comme une mesure générale des capacités d’un modèle.
La combinaison de jugements humains professionnels et d’indicateurs automatiques renforce la diversité de l’évaluation. Dans la base considérée, la fiabilité reste toutefois à nuancer, car les résultats sont majoritairement auto-déclarés par les éditeurs. Le caractère public du benchmark appelle également à la prudence face au risque de contamination. Avec quatre modèles évalués, un score médian de 73 % et Gemini 1.5 Pro en tête à 75 %, le classement montre des performances rapprochées. Ce faible écart peut limiter le pouvoir discriminant du classement et évoquer une forme de saturation parmi les modèles recensés, sans effacer l’intérêt des analyses par domaine, direction de traduction et méthode d’évaluation.
Sources des scores : llm-stats.