FLEURS

FLEURS, créé par Google Research en 2022, est un jeu de données vocales parallèles fondé sur FLoRes-101. Il rassemble des enregistrements multilingues accompagnés de transcriptions et d’étiquettes afin d’évaluer le traitement automatique de la parole dans un large éventail linguistique.

FLEURS, créé par Google Research en 2022, est un jeu de données vocales parallèles fondé sur FLoRes-101. Il rassemble des enregistrements multilingues accompagnés de transcriptions et d’étiquettes afin d’évaluer le traitement automatique de la parole dans un large éventail linguistique.

Le benchmark mesure notamment la reconnaissance automatique de la parole, l’identification de la langue parlée et l’apprentissage few-shot de représentations universelles. Il sert aussi de support à l’évaluation de tâches de traduction et de recherche à partir de contenus vocaux.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle Research
Capacités mesuréeslangage, reconnaissance vocale
ModalitéAudio
Type de questionsenregistrements audio multilingues avec transcriptions et étiquettes, utilisés pour ASR, identification de langue, traduction et recherche
Métrique d'évaluationaccuracy (1 - word error rate)
AccèsPublic
LicenceCC-BY-4.0
Languesmultilingue (102 langues)
Taille du jeuenviron 2009 énoncés parallèles par langue dans 102 langues, soit environ 12 heures de parole par langue
Année de publication2022
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert95,9 %27 mars 2025Auto-déclaré
2Gemini 1.0 ProGoogle🔒 Propriétaire93,6 %15 février 2024n.d.
3Gemini 1.5 ProGoogle🔒 Propriétaire93,3 %1 mai 2024Auto-déclaré
4Gemma 4 12BGoogle🟢 Ouvert93,1 %23 mai 2026Auto-déclaré
5Gemini 1.5 FlashGoogle🔒 Propriétaire90,4 %1 mai 2024Auto-déclaré
6Gemini 1.5 Flash 8BGoogle🔒 Propriétaire86,4 %15 mars 2024Auto-déclaré

Classement établi sur 6 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 93,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur FLEURS correspond à une faible proportion d’erreurs de mots, puisque l’accuracy est calculée comme 1 moins le word error rate. Il indique donc une transcription plus fidèle des énoncés multilingues du jeu, sans résumer à lui seul toutes les capacités vocales d’un modèle. Avec une médiane de 93 % et un meilleur résultat de 96 %, les scores observés sont resserrés vers le haut, ce qui suggère une capacité limitée à départager finement les meilleurs systèmes et un possible effet de saturation.

L’interprétation exige aussi plusieurs précautions. Les résultats sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans le cadre d’une mesure indépendante uniforme. Le caractère public du jeu appelle également à considérer le risque de contamination lors de l’évaluation. Enfin, le classement ne porte que sur six modèles. Qwen2.5-Omni-7B arrive en tête, mais cinq des six modèles classés sont édités par Google, également à l’origine du benchmark. Cette concentration réduit l’indépendance de la comparaison entre les modèles Google et ceux d’autres éditeurs.


Sources des scores : llm-stats.