FLEURS
FLEURS, créé par Google Research en 2022, est un jeu de données vocales parallèles fondé sur FLoRes-101. Il rassemble des enregistrements multilingues accompagnés de transcriptions et d’étiquettes afin d’évaluer le traitement automatique de la parole dans un large éventail linguistique.
FLEURS, créé par Google Research en 2022, est un jeu de données vocales parallèles fondé sur FLoRes-101. Il rassemble des enregistrements multilingues accompagnés de transcriptions et d’étiquettes afin d’évaluer le traitement automatique de la parole dans un large éventail linguistique.
Le benchmark mesure notamment la reconnaissance automatique de la parole, l’identification de la langue parlée et l’apprentissage few-shot de représentations universelles. Il sert aussi de support à l’évaluation de tâches de traduction et de recherche à partir de contenus vocaux.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google Research |
| Capacités mesurées | langage, reconnaissance vocale |
| Modalité | Audio |
| Type de questions | enregistrements audio multilingues avec transcriptions et étiquettes, utilisés pour ASR, identification de langue, traduction et recherche |
| Métrique d'évaluation | accuracy (1 - word error rate) |
| Accès | Public |
| Licence | CC-BY-4.0 |
| Langues | multilingue (102 langues) |
| Taille du jeu | environ 2009 énoncés parallèles par langue dans 102 langues, soit environ 12 heures de parole par langue |
| Année de publication | 2022 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,9 % | 27 mars 2025 | Auto-déclaré |
| 2 | Gemini 1.0 Pro | 🔒 Propriétaire | 93,6 % | 15 février 2024 | n.d. | |
| 3 | Gemini 1.5 Pro | 🔒 Propriétaire | 93,3 % | 1 mai 2024 | Auto-déclaré | |
| 4 | Gemma 4 12B | 🟢 Ouvert | 93,1 % | 23 mai 2026 | Auto-déclaré | |
| 5 | Gemini 1.5 Flash | 🔒 Propriétaire | 90,4 % | 1 mai 2024 | Auto-déclaré | |
| 6 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 86,4 % | 15 mars 2024 | Auto-déclaré |
Classement établi sur 6 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 93,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur FLEURS correspond à une faible proportion d’erreurs de mots, puisque l’accuracy est calculée comme 1 moins le word error rate. Il indique donc une transcription plus fidèle des énoncés multilingues du jeu, sans résumer à lui seul toutes les capacités vocales d’un modèle. Avec une médiane de 93 % et un meilleur résultat de 96 %, les scores observés sont resserrés vers le haut, ce qui suggère une capacité limitée à départager finement les meilleurs systèmes et un possible effet de saturation.
L’interprétation exige aussi plusieurs précautions. Les résultats sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans le cadre d’une mesure indépendante uniforme. Le caractère public du jeu appelle également à considérer le risque de contamination lors de l’évaluation. Enfin, le classement ne porte que sur six modèles. Qwen2.5-Omni-7B arrive en tête, mais cinq des six modèles classés sont édités par Google, également à l’origine du benchmark. Cette concentration réduit l’indépendance de la comparaison entre les modèles Google et ceux d’autres éditeurs.
Sources des scores : llm-stats.