CoVoST2

CoVoST2 est un benchmark de traduction automatique de la parole, créé en 2020 par Facebook AI Research, aujourd’hui Meta AI, avec Changhan Wang et ses coauteurs. Issu de Common Voice, il rassemble des segments audio multilingues associés à des traductions textuelles.

CoVoST2 est un benchmark de traduction automatique de la parole, créé en 2020 par Facebook AI Research, aujourd’hui Meta AI, avec Changhan Wang et ses coauteurs. Issu de Common Voice, il rassemble des segments audio multilingues associés à des traductions textuelles.

Le benchmark mesure la capacité d’un modèle à transcrire et traduire la parole vers une langue cible, selon plusieurs directions impliquant l’anglais. Il sert à comparer les performances des systèmes de traduction parole-texte au moyen du score BLEU, sur un corpus commun à grande échelle.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkFacebook AI Research (Meta AI), Changhan Wang et al.
Capacités mesuréesaudio, langage, reconnaissance vocale
ModalitéAudio
Type de questionstraduction parole-texte : segments audio à traduire en texte dans une langue cible
Métrique d'évaluationBLEU
AccèsPublic
LicenceCC-BY-NC-4.0
Languesmultilingue : 21 langues vers l’anglais et anglais vers 15 langues
Taille du jeuenviron 2 880 heures de parole, 78 000 locuteurs
Année de publication2020
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Nova 2 OmniAmazon🔒 Propriétaire40,7 %2 décembre 2025Auto-déclaré
2Gemini 2.0 FlashGoogle🔒 Propriétaire39,2 %21 janvier 2025Auto-déclaré
3Gemma 4 12BGoogle🟢 Ouvert38,5 %23 mai 2026Auto-déclaré
4Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire38,4 %5 février 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 38,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score BLEU élevé sur CoVoST2 indique une meilleure performance de traduction parole-texte sur les segments audio et les directions linguistiques couverts. Dans la base, Nova 2 Omni arrive en tête à 41 %, tandis que le score médian des quatre modèles évalués atteint 39 %. Cet écart limité entre le meilleur résultat et la médiane suggère un classement resserré, mais le faible nombre de modèles réduit la portée des comparaisons et ne suffit pas à établir une saturation générale du benchmark. La rigueur de lecture doit aussi tenir compte de l’origine des résultats, majoritairement auto-déclarés par les éditeurs, plutôt qu’issus d’une évaluation indépendante homogène. Le caractère public du corpus peut par ailleurs créer un risque d’exposition des données lors du développement des modèles, ce qui invite à considérer la contamination comme une limite possible. Enfin, CoVoST2 évalue une capacité précise, la traduction de parole multilingue impliquant l’anglais dans les directions couvertes. Son classement ne constitue donc pas une mesure générale des aptitudes d’un modèle d’IA.


Sources des scores : llm-stats.