CoVoST2
CoVoST2 est un benchmark de traduction automatique de la parole, créé en 2020 par Facebook AI Research, aujourd’hui Meta AI, avec Changhan Wang et ses coauteurs. Issu de Common Voice, il rassemble des segments audio multilingues associés à des traductions textuelles.
CoVoST2 est un benchmark de traduction automatique de la parole, créé en 2020 par Facebook AI Research, aujourd’hui Meta AI, avec Changhan Wang et ses coauteurs. Issu de Common Voice, il rassemble des segments audio multilingues associés à des traductions textuelles.
Le benchmark mesure la capacité d’un modèle à transcrire et traduire la parole vers une langue cible, selon plusieurs directions impliquant l’anglais. Il sert à comparer les performances des systèmes de traduction parole-texte au moyen du score BLEU, sur un corpus commun à grande échelle.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Facebook AI Research (Meta AI), Changhan Wang et al. |
| Capacités mesurées | audio, langage, reconnaissance vocale |
| Modalité | Audio |
| Type de questions | traduction parole-texte : segments audio à traduire en texte dans une langue cible |
| Métrique d'évaluation | BLEU |
| Accès | Public |
| Licence | CC-BY-NC-4.0 |
| Langues | multilingue : 21 langues vers l’anglais et anglais vers 15 langues |
| Taille du jeu | environ 2 880 heures de parole, 78 000 locuteurs |
| Année de publication | 2020 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 40,7 % | 2 décembre 2025 | Auto-déclaré |
| 2 | Gemini 2.0 Flash | 🔒 Propriétaire | 39,2 % | 21 janvier 2025 | Auto-déclaré | |
| 3 | Gemma 4 12B | 🟢 Ouvert | 38,5 % | 23 mai 2026 | Auto-déclaré | |
| 4 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 38,4 % | 5 février 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 38,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score BLEU élevé sur CoVoST2 indique une meilleure performance de traduction parole-texte sur les segments audio et les directions linguistiques couverts. Dans la base, Nova 2 Omni arrive en tête à 41 %, tandis que le score médian des quatre modèles évalués atteint 39 %. Cet écart limité entre le meilleur résultat et la médiane suggère un classement resserré, mais le faible nombre de modèles réduit la portée des comparaisons et ne suffit pas à établir une saturation générale du benchmark. La rigueur de lecture doit aussi tenir compte de l’origine des résultats, majoritairement auto-déclarés par les éditeurs, plutôt qu’issus d’une évaluation indépendante homogène. Le caractère public du corpus peut par ailleurs créer un risque d’exposition des données lors du développement des modèles, ce qui invite à considérer la contamination comme une limite possible. Enfin, CoVoST2 évalue une capacité précise, la traduction de parole multilingue impliquant l’anglais dans les directions couvertes. Son classement ne constitue donc pas une mesure générale des aptitudes d’un modèle d’IA.
Sources des scores : llm-stats.