MAEB Audio-Only
MTEB: MAEB Audio-Only est un benchmark public conçu par l’équipe MTEB dans le cadre du projet MAEB. Il évalue la qualité des embeddings audio appliqués à la parole, à la musique et aux sons environnementaux, notamment au moyen de tâches de classification, de clustering, de comparaison de…
MTEB: MAEB Audio-Only est un benchmark public conçu par l’équipe MTEB dans le cadre du projet MAEB. Il évalue la qualité des embeddings audio appliqués à la parole, à la musique et aux sons environnementaux, notamment au moyen de tâches de classification, de clustering, de comparaison de paires, de reranking et de retrieval.
Ce sous-ensemble centré sur l’audio permet de comparer la capacité des modèles à produire des représentations utiles dans plusieurs contextes. Les résultats sont agrégés selon l’approche MTEB à partir de métriques adaptées à chaque tâche.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Equipe MTEB (projet MAEB) |
| Capacités mesurées | Qualite des embeddings audio sur parole, musique et sons environnementaux |
| Modalité | Audio |
| Type de questions | evaluation d'embeddings audio : classification, clustering, classification de paires, reranking, retrieval |
| Métrique d'évaluation | metriques par tache agregees facon MTEB (ex. exactitude, NDCG, etc.) |
| Accès | Public |
| Langues | 100+ langues (volet parole) |
| Taille du jeu | 19 taches (sous-ensemble audio-only de MAEB ; MAEB complet = 30 taches, MAEB+ = 98) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (60)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | BidirLM/BidirLM-Omni-2.5B-Embedding | BidirLM | 🟢 Ouvert | 53,6 % | 7 avril 2026 | ✅ Mesuré |
| 2 | LCO-Embedding/LCO-Embedding-Omni-7B | LCO-Embedding | 🟢 Ouvert | 51,5 % | 15 octobre 2025 | ✅ Mesuré |
| 3 | Qwen/Qwen2-Audio-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,0 % | 9 août 2024 | ✅ Mesuré |
| 4 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 50,2 % | 1 avril 2026 | ✅ Mesuré |
| 5 | Haon-Chen/e5-omni-7B | Haon-Chen | 🟢 Ouvert | 50,2 % | 6 janvier 2026 | ✅ Mesuré |
| 6 | LCO-Embedding/LCO-Embedding-Omni-3B | LCO-Embedding | 🟢 Ouvert | 49,8 % | 23 octobre 2025 | ✅ Mesuré |
| 7 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 49,7 % | 1 avril 2026 | ✅ Mesuré |
| 8 | openai/whisper-medium | OpenAI | 🟢 Ouvert | 48,4 % | 27 septembre 2022 | ✅ Mesuré |
| 9 | Tevatron/OmniEmbed-v0.1 | Tevatron | 🟢 Ouvert | 47,3 % | 12 avril 2025 | ✅ Mesuré |
| 10 | Haon-Chen/e5-omni-3B | Haon-Chen | 🟢 Ouvert | 46,6 % | 6 janvier 2026 | ✅ Mesuré |
| 11 | laion/larger_clap_general | laion | 🟢 Ouvert | 45,5 % | 22 mai 2023 | ✅ Mesuré |
| 12 | laion/larger_clap_music_and_speech | laion | 🟢 Ouvert | 45,4 % | 22 mai 2023 | ✅ Mesuré |
| 13 | openai/whisper-small | OpenAI | 🟢 Ouvert | 45,1 % | 27 septembre 2022 | ✅ Mesuré |
| 14 | openai/whisper-base | OpenAI | 🟢 Ouvert | 44,9 % | 27 septembre 2022 | ✅ Mesuré |
| 15 | MIT/ast-finetuned-audioset-10-10-0.4593 | MIT | 🟢 Ouvert | 44,7 % | 8 juillet 2021 | ✅ Mesuré |
| 16 | encord-team/ebind-full | encord-team | 🟢 Ouvert | 44,6 % | 19 novembre 2025 | ✅ Mesuré |
| 17 | microsoft/msclap-2023 | Microsoft | 🟢 Ouvert | 44,2 % | 1 septembre 2023 | ✅ Mesuré |
| 18 | openai/whisper-tiny | OpenAI | 🟢 Ouvert | 43,6 % | 27 septembre 2022 | ✅ Mesuré |
| 19 | laion/clap-htsat-fused | laion | 🟢 Ouvert | 43,5 % | 22 mai 2023 | ✅ Mesuré |
| 20 | laion/clap-htsat-unfused | laion | 🟢 Ouvert | 42,9 % | 22 mai 2023 | ✅ Mesuré |
| 21 | facebook/mms-1b-fl102 | Meta | 🟢 Ouvert | 41,4 % | 22 mai 2023 | ✅ Mesuré |
| 22 | facebook/seamless-m4t-v2-large | Meta | 🟢 Ouvert | 41,3 % | 6 novembre 2023 | ✅ Mesuré |
| 23 | google/vggish | 🟢 Ouvert | 41,1 % | 13 juin 2019 | ✅ Mesuré | |
| 24 | matthewagi/HeAR-s1.1 | matthewagi | 🟢 Ouvert | 41,1 % | 26 mars 2026 | ✅ Mesuré |
| 25 | facebook/wav2vec2-xls-r-2b | Meta | 🟢 Ouvert | 41,0 % | 10 septembre 2024 | ✅ Mesuré |
| 26 | OpenMuQ/MuQ-MuLan-large | OpenMuQ | 🟢 Ouvert | 40,9 % | 1 janvier 2025 | ✅ Mesuré |
| 27 | facebook/mms-1b-all | Meta | 🟢 Ouvert | 40,7 % | 22 mai 2023 | ✅ Mesuré |
| 28 | microsoft/msclap-2022 | Microsoft | 🟢 Ouvert | 40,1 % | 1 décembre 2022 | ✅ Mesuré |
| 29 | facebook/mms-1b-l1107 | Meta | 🟢 Ouvert | 40,0 % | 22 mai 2023 | ✅ Mesuré |
| 30 | facebook/wav2vec2-lv-60-espeak-cv-ft | Meta | 🟢 Ouvert | 39,8 % | 26 octobre 2020 | ✅ Mesuré |
| 31 | microsoft/wavlm-large | Microsoft | 🟢 Ouvert | 39,8 % | 19 juillet 2022 | ✅ Mesuré |
| 32 | facebook/hubert-base-ls960 | Meta | 🟢 Ouvert | 39,5 % | 14 juin 2021 | ✅ Mesuré |
| 33 | google/yamnet | 🟢 Ouvert | 39,3 % | 6 octobre 2020 | ✅ Mesuré | |
| 34 | lyrebird/wav2clip | lyrebird | 🟢 Ouvert | 38,8 % | 15 mars 2022 | ✅ Mesuré |
| 35 | vitouphy/wav2vec2-xls-r-300m-phoneme | vitouphy | 🟢 Ouvert | 38,1 % | 19 mai 2022 | ✅ Mesuré |
| 36 | microsoft/speecht5_multimodal | Microsoft | 🟢 Ouvert | 37,7 % | 16 mai 2022 | ✅ Mesuré |
| 37 | microsoft/wavlm-base | Microsoft | 🟢 Ouvert | 37,1 % | 19 juillet 2022 | ✅ Mesuré |
| 38 | microsoft/wavlm-base-sd | Microsoft | 🟢 Ouvert | 37,1 % | 19 juillet 2022 | ✅ Mesuré |
| 39 | microsoft/wavlm-base-sv | Microsoft | 🟢 Ouvert | 37,1 % | 19 juillet 2022 | ✅ Mesuré |
| 40 | facebook/wav2vec2-base | Meta | 🟢 Ouvert | 37,0 % | 26 octobre 2020 | ✅ Mesuré |
| 41 | facebook/wav2vec2-xls-r-1b | Meta | 🟢 Ouvert | 36,9 % | 10 septembre 2024 | ✅ Mesuré |
| 42 | microsoft/wavlm-base-plus | Microsoft | 🟢 Ouvert | 36,3 % | 19 juillet 2022 | ✅ Mesuré |
| 43 | microsoft/wavlm-base-plus-sd | Microsoft | 🟢 Ouvert | 36,3 % | 19 juillet 2022 | ✅ Mesuré |
| 44 | microsoft/wavlm-base-plus-sv | Microsoft | 🟢 Ouvert | 36,3 % | 19 juillet 2022 | ✅ Mesuré |
| 45 | speechbrain/m-ctc-t-large | speechbrain | 🟢 Ouvert | 35,8 % | 10 janvier 2022 | ✅ Mesuré |
| 46 | facebook/hubert-large-ls960-ft | Meta | 🟢 Ouvert | 35,2 % | 14 juin 2021 | ✅ Mesuré |
| 47 | speechbrain/cnn14-esc50 | speechbrain | 🟢 Ouvert | 35,0 % | 26 novembre 2022 | ✅ Mesuré |
| 48 | facebook/data2vec-audio-large-960h | Meta | 🟢 Ouvert | 34,7 % | 7 février 2022 | ✅ Mesuré |
| 49 | Qwen/Qwen2.5-Omni-3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 33,5 % | 30 avril 2025 | ✅ Mesuré |
| 50 | microsoft/unispeech-sat-base-100h-libri-ft | Microsoft | 🟢 Ouvert | 33,1 % | 12 octobre 2021 | ✅ Mesuré |
| 51 | asapp/sew-d-tiny-100k-ft-ls100h | ASAPP | 🟢 Ouvert | 33,0 % | 14 septembre 2021 | ✅ Mesuré |
| 52 | facebook/wav2vec2-xls-r-300m | Meta | 🟢 Ouvert | 32,4 % | 13 octobre 2021 | ✅ Mesuré |
| 53 | facebook/data2vec-audio-base-960h | Meta | 🟢 Ouvert | 32,3 % | 7 février 2022 | ✅ Mesuré |
| 54 | facebook/wav2vec2-large | Meta | 🟢 Ouvert | 32,3 % | 26 octobre 2020 | ✅ Mesuré |
| 55 | facebook/wav2vec2-base-960h | Meta | 🟢 Ouvert | 31,3 % | 26 octobre 2020 | ✅ Mesuré |
| 56 | asapp/sew-d-base-plus-400k-ft-ls100h | ASAPP | 🟢 Ouvert | 30,9 % | 14 septembre 2021 | ✅ Mesuré |
| 57 | laion/larger_clap_music | laion | 🟢 Ouvert | 30,6 % | 22 mai 2023 | ✅ Mesuré |
| 58 | asapp/sew-d-mid-400k-ft-ls100h | ASAPP | 🟢 Ouvert | 30,5 % | 14 septembre 2021 | ✅ Mesuré |
| 59 | facebook/encodec_24khz | Meta | 🟢 Ouvert | 30,4 % | 25 octobre 2022 | ✅ Mesuré |
| 60 | facebook/wav2vec2-large-xlsr-53 | Meta | 🟢 Ouvert | 26,4 % | 26 octobre 2020 | ✅ Mesuré |
Classement établi sur 60 modèles évalués, dont 34 de grands éditeurs. Score médian de l'ensemble : 39,8 %.
Notre analyse
Un score élevé indique qu’un modèle produit des embeddings audio efficaces sur un ensemble varié de tâches, plutôt qu’une performance limitée à un seul usage. Avec une médiane de 40 % parmi les 61 modèles recensés et un meilleur score de 54 % pour BidirLM/BidirLM-Omni-2.5B-Embedding, le classement fait apparaître une avance mesurable du premier modèle, sans saturation apparente au sommet. Il met aussi en évidence une marge de progression globale.
La portée reste circonscrite aux 19 tâches audio-only de MAEB, même si celles-ci couvrent la parole, la musique, les sons environnementaux et plus de 100 langues pour le volet parole. Le benchmark est encore en bêta dans l’attente d’une évaluation par les pairs. La rigueur d’interprétation du classement doit également tenir compte du fait que les scores sont majoritairement auto-déclarés par les éditeurs, ce qui les distingue de résultats intégralement mesurés dans un cadre indépendant. Le score agrégé synthétise enfin plusieurs métriques par tâche et doit être lu comme une performance d’ensemble.
Sources des scores : mteb.