MAEB Audio-Only

MTEB: MAEB Audio-Only est un benchmark public conçu par l’équipe MTEB dans le cadre du projet MAEB. Il évalue la qualité des embeddings audio appliqués à la parole, à la musique et aux sons environnementaux, notamment au moyen de tâches de classification, de clustering, de comparaison de…

MTEB: MAEB Audio-Only est un benchmark public conçu par l’équipe MTEB dans le cadre du projet MAEB. Il évalue la qualité des embeddings audio appliqués à la parole, à la musique et aux sons environnementaux, notamment au moyen de tâches de classification, de clustering, de comparaison de paires, de reranking et de retrieval.

Ce sous-ensemble centré sur l’audio permet de comparer la capacité des modèles à produire des représentations utiles dans plusieurs contextes. Les résultats sont agrégés selon l’approche MTEB à partir de métriques adaptées à chaque tâche.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEquipe MTEB (projet MAEB)
Capacités mesuréesQualite des embeddings audio sur parole, musique et sons environnementaux
ModalitéAudio
Type de questionsevaluation d'embeddings audio : classification, clustering, classification de paires, reranking, retrieval
Métrique d'évaluationmetriques par tache agregees facon MTEB (ex. exactitude, NDCG, etc.)
AccèsPublic
Langues100+ langues (volet parole)
Taille du jeu19 taches (sous-ensemble audio-only de MAEB ; MAEB complet = 30 taches, MAEB+ = 98)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (60)

#ModèleÉditeurLicenceScoreSortieFiabilité
1BidirLM/BidirLM-Omni-2.5B-EmbeddingBidirLM🟢 Ouvert53,6 %7 avril 2026✅ Mesuré
2LCO-Embedding/LCO-Embedding-Omni-7BLCO-Embedding🟢 Ouvert51,5 %15 octobre 2025✅ Mesuré
3Qwen/Qwen2-Audio-7BAlibaba Cloud / Qwen Team🟢 Ouvert51,0 %9 août 2024✅ Mesuré
4jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert50,2 %1 avril 2026✅ Mesuré
5Haon-Chen/e5-omni-7BHaon-Chen🟢 Ouvert50,2 %6 janvier 2026✅ Mesuré
6LCO-Embedding/LCO-Embedding-Omni-3BLCO-Embedding🟢 Ouvert49,8 %23 octobre 2025✅ Mesuré
7jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert49,7 %1 avril 2026✅ Mesuré
8openai/whisper-mediumOpenAI🟢 Ouvert48,4 %27 septembre 2022✅ Mesuré
9Tevatron/OmniEmbed-v0.1Tevatron🟢 Ouvert47,3 %12 avril 2025✅ Mesuré
10Haon-Chen/e5-omni-3BHaon-Chen🟢 Ouvert46,6 %6 janvier 2026✅ Mesuré
11laion/larger_clap_generallaion🟢 Ouvert45,5 %22 mai 2023✅ Mesuré
12laion/larger_clap_music_and_speechlaion🟢 Ouvert45,4 %22 mai 2023✅ Mesuré
13openai/whisper-smallOpenAI🟢 Ouvert45,1 %27 septembre 2022✅ Mesuré
14openai/whisper-baseOpenAI🟢 Ouvert44,9 %27 septembre 2022✅ Mesuré
15MIT/ast-finetuned-audioset-10-10-0.4593MIT🟢 Ouvert44,7 %8 juillet 2021✅ Mesuré
16encord-team/ebind-fullencord-team🟢 Ouvert44,6 %19 novembre 2025✅ Mesuré
17microsoft/msclap-2023Microsoft🟢 Ouvert44,2 %1 septembre 2023✅ Mesuré
18openai/whisper-tinyOpenAI🟢 Ouvert43,6 %27 septembre 2022✅ Mesuré
19laion/clap-htsat-fusedlaion🟢 Ouvert43,5 %22 mai 2023✅ Mesuré
20laion/clap-htsat-unfusedlaion🟢 Ouvert42,9 %22 mai 2023✅ Mesuré
21facebook/mms-1b-fl102Meta🟢 Ouvert41,4 %22 mai 2023✅ Mesuré
22facebook/seamless-m4t-v2-largeMeta🟢 Ouvert41,3 %6 novembre 2023✅ Mesuré
23google/vggishGoogle🟢 Ouvert41,1 %13 juin 2019✅ Mesuré
24matthewagi/HeAR-s1.1matthewagi🟢 Ouvert41,1 %26 mars 2026✅ Mesuré
25facebook/wav2vec2-xls-r-2bMeta🟢 Ouvert41,0 %10 septembre 2024✅ Mesuré
26OpenMuQ/MuQ-MuLan-largeOpenMuQ🟢 Ouvert40,9 %1 janvier 2025✅ Mesuré
27facebook/mms-1b-allMeta🟢 Ouvert40,7 %22 mai 2023✅ Mesuré
28microsoft/msclap-2022Microsoft🟢 Ouvert40,1 %1 décembre 2022✅ Mesuré
29facebook/mms-1b-l1107Meta🟢 Ouvert40,0 %22 mai 2023✅ Mesuré
30facebook/wav2vec2-lv-60-espeak-cv-ftMeta🟢 Ouvert39,8 %26 octobre 2020✅ Mesuré
31microsoft/wavlm-largeMicrosoft🟢 Ouvert39,8 %19 juillet 2022✅ Mesuré
32facebook/hubert-base-ls960Meta🟢 Ouvert39,5 %14 juin 2021✅ Mesuré
33google/yamnetGoogle🟢 Ouvert39,3 %6 octobre 2020✅ Mesuré
34lyrebird/wav2cliplyrebird🟢 Ouvert38,8 %15 mars 2022✅ Mesuré
35vitouphy/wav2vec2-xls-r-300m-phonemevitouphy🟢 Ouvert38,1 %19 mai 2022✅ Mesuré
36microsoft/speecht5_multimodalMicrosoft🟢 Ouvert37,7 %16 mai 2022✅ Mesuré
37microsoft/wavlm-baseMicrosoft🟢 Ouvert37,1 %19 juillet 2022✅ Mesuré
38microsoft/wavlm-base-sdMicrosoft🟢 Ouvert37,1 %19 juillet 2022✅ Mesuré
39microsoft/wavlm-base-svMicrosoft🟢 Ouvert37,1 %19 juillet 2022✅ Mesuré
40facebook/wav2vec2-baseMeta🟢 Ouvert37,0 %26 octobre 2020✅ Mesuré
41facebook/wav2vec2-xls-r-1bMeta🟢 Ouvert36,9 %10 septembre 2024✅ Mesuré
42microsoft/wavlm-base-plusMicrosoft🟢 Ouvert36,3 %19 juillet 2022✅ Mesuré
43microsoft/wavlm-base-plus-sdMicrosoft🟢 Ouvert36,3 %19 juillet 2022✅ Mesuré
44microsoft/wavlm-base-plus-svMicrosoft🟢 Ouvert36,3 %19 juillet 2022✅ Mesuré
45speechbrain/m-ctc-t-largespeechbrain🟢 Ouvert35,8 %10 janvier 2022✅ Mesuré
46facebook/hubert-large-ls960-ftMeta🟢 Ouvert35,2 %14 juin 2021✅ Mesuré
47speechbrain/cnn14-esc50speechbrain🟢 Ouvert35,0 %26 novembre 2022✅ Mesuré
48facebook/data2vec-audio-large-960hMeta🟢 Ouvert34,7 %7 février 2022✅ Mesuré
49Qwen/Qwen2.5-Omni-3BAlibaba Cloud / Qwen Team🟢 Ouvert33,5 %30 avril 2025✅ Mesuré
50microsoft/unispeech-sat-base-100h-libri-ftMicrosoft🟢 Ouvert33,1 %12 octobre 2021✅ Mesuré
51asapp/sew-d-tiny-100k-ft-ls100hASAPP🟢 Ouvert33,0 %14 septembre 2021✅ Mesuré
52facebook/wav2vec2-xls-r-300mMeta🟢 Ouvert32,4 %13 octobre 2021✅ Mesuré
53facebook/data2vec-audio-base-960hMeta🟢 Ouvert32,3 %7 février 2022✅ Mesuré
54facebook/wav2vec2-largeMeta🟢 Ouvert32,3 %26 octobre 2020✅ Mesuré
55facebook/wav2vec2-base-960hMeta🟢 Ouvert31,3 %26 octobre 2020✅ Mesuré
56asapp/sew-d-base-plus-400k-ft-ls100hASAPP🟢 Ouvert30,9 %14 septembre 2021✅ Mesuré
57laion/larger_clap_musiclaion🟢 Ouvert30,6 %22 mai 2023✅ Mesuré
58asapp/sew-d-mid-400k-ft-ls100hASAPP🟢 Ouvert30,5 %14 septembre 2021✅ Mesuré
59facebook/encodec_24khzMeta🟢 Ouvert30,4 %25 octobre 2022✅ Mesuré
60facebook/wav2vec2-large-xlsr-53Meta🟢 Ouvert26,4 %26 octobre 2020✅ Mesuré

Classement établi sur 60 modèles évalués, dont 34 de grands éditeurs. Score médian de l'ensemble : 39,8 %.

Notre analyse

Un score élevé indique qu’un modèle produit des embeddings audio efficaces sur un ensemble varié de tâches, plutôt qu’une performance limitée à un seul usage. Avec une médiane de 40 % parmi les 61 modèles recensés et un meilleur score de 54 % pour BidirLM/BidirLM-Omni-2.5B-Embedding, le classement fait apparaître une avance mesurable du premier modèle, sans saturation apparente au sommet. Il met aussi en évidence une marge de progression globale.

La portée reste circonscrite aux 19 tâches audio-only de MAEB, même si celles-ci couvrent la parole, la musique, les sons environnementaux et plus de 100 langues pour le volet parole. Le benchmark est encore en bêta dans l’attente d’une évaluation par les pairs. La rigueur d’interprétation du classement doit également tenir compte du fait que les scores sont majoritairement auto-déclarés par les éditeurs, ce qui les distingue de résultats intégralement mesurés dans un cadre indépendant. Le score agrégé synthétise enfin plusieurs métriques par tâche et doit être lu comme une performance d’ensemble.


Sources des scores : mteb.