MAEB

MTEB: MAEB est un benchmark communautaire créé par MTEB / embeddings-benchmark pour évaluer la qualité des embeddings audio. Il couvre la parole, la musique et les sons environnementaux, ainsi que les relations entre contenus audio et texte.

MTEB: MAEB est un benchmark communautaire créé par MTEB / embeddings-benchmark pour évaluer la qualité des embeddings audio. Il couvre la parole, la musique et les sons environnementaux, ainsi que les relations entre contenus audio et texte.

Son protocole réunit des tâches de recherche, classification, clustering, reranking et classification zero-shot, entre autres. Cette diversité permet de comparer la capacité des modèles à produire des représentations utiles dans plusieurs contextes audio, monomodaux ou cross-modaux, et dans plus de 100 langues.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / embeddings-benchmark (communauté)
Capacités mesuréesÉvaluation de la qualité des embeddings audio (parole, musique, sons environnementaux) et tâches audio-texte cross-modales
Modalitéaudio,text
Type de questionsqualité des embeddings audio (retrieval, classification, clustering, reranking, zero-shot, etc.)
Métrique d'évaluationmétriques variables selon la tâche (NDCG, exactitude, etc.)
AccèsPublic
Languesplus de 100 langues
Taille du jeu30 tâches sélectionnées (dérivées de MAEB+, 98 tâches au total)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (21)

#ModèleÉditeurLicenceScoreSortieFiabilité
1LCO-Embedding/LCO-Embedding-Omni-7BLCO-Embedding🟢 Ouvert53,5 %15 octobre 2025✅ Mesuré
2Haon-Chen/e5-omni-7BHaon-Chen🟢 Ouvert52,5 %6 janvier 2026✅ Mesuré
3BidirLM/BidirLM-Omni-2.5B-EmbeddingBidirLM🟢 Ouvert52,4 %7 avril 2026✅ Mesuré
4LCO-Embedding/LCO-Embedding-Omni-3BLCO-Embedding🟢 Ouvert52,3 %23 octobre 2025✅ Mesuré
5jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert50,4 %1 avril 2026✅ Mesuré
6jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert50,1 %1 avril 2026✅ Mesuré
7Haon-Chen/e5-omni-3BHaon-Chen🟢 Ouvert48,0 %6 janvier 2026✅ Mesuré
8Tevatron/OmniEmbed-v0.1Tevatron🟢 Ouvert43,9 %12 avril 2025✅ Mesuré
9laion/larger_clap_generallaion🟢 Ouvert35,0 %22 mai 2023✅ Mesuré
10laion/larger_clap_music_and_speechlaion🟢 Ouvert34,7 %22 mai 2023✅ Mesuré
11Qwen/Qwen2-Audio-7BAlibaba Cloud / Qwen Team🟢 Ouvert34,5 %9 août 2024✅ Mesuré
12microsoft/msclap-2023Microsoft🟢 Ouvert34,0 %1 septembre 2023✅ Mesuré
13laion/clap-htsat-fusedlaion🟢 Ouvert33,5 %22 mai 2023✅ Mesuré
14laion/clap-htsat-unfusedlaion🟢 Ouvert33,0 %22 mai 2023✅ Mesuré
15encord-team/ebind-fullencord-team🟢 Ouvert32,8 %19 novembre 2025✅ Mesuré
16microsoft/msclap-2022Microsoft🟢 Ouvert32,2 %1 décembre 2022✅ Mesuré
17OpenMuQ/MuQ-MuLan-largeOpenMuQ🟢 Ouvert28,2 %1 janvier 2025✅ Mesuré
18lyrebird/wav2cliplyrebird🟢 Ouvert26,6 %15 mars 2022✅ Mesuré
19microsoft/speecht5_multimodalMicrosoft🟢 Ouvert26,4 %16 mai 2022✅ Mesuré
20Qwen/Qwen2.5-Omni-3BAlibaba Cloud / Qwen Team🟢 Ouvert23,4 %30 avril 2025✅ Mesuré
21laion/larger_clap_musiclaion🟢 Ouvert20,7 %22 mai 2023✅ Mesuré

Classement établi sur 21 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 34,5 %.

Notre analyse

Un score élevé indique qu’un modèle produit des embeddings performants sur un éventail de tâches, selon des métriques adaptées comme la NDCG ou l’exactitude. La comparaison doit néanmoins rester prudente, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment. Le benchmark est par ailleurs encore en bêta, dans l’attente d’une évaluation par les pairs.

Le niveau médian de 35 % et le meilleur score de 54 % suggèrent que le benchmark n’est pas saturé. Le classement fait ressortir LCO-Embedding/LCO-Embedding-Omni-7B, tout en montrant un écart substantiel entre la meilleure performance et le niveau central des modèles évalués. La portée reste celle des 30 tâches sélectionnées parmi les 98 tâches de MAEB+, malgré une couverture étendue des usages et des langues. Enfin, l’accès public impose de considérer le risque méthodologique de contamination lors de l’interprétation des scores, sans établir qu’une telle exposition a effectivement eu lieu.


Sources des scores : mteb.