MAEB
MTEB: MAEB est un benchmark communautaire créé par MTEB / embeddings-benchmark pour évaluer la qualité des embeddings audio. Il couvre la parole, la musique et les sons environnementaux, ainsi que les relations entre contenus audio et texte.
MTEB: MAEB est un benchmark communautaire créé par MTEB / embeddings-benchmark pour évaluer la qualité des embeddings audio. Il couvre la parole, la musique et les sons environnementaux, ainsi que les relations entre contenus audio et texte.
Son protocole réunit des tâches de recherche, classification, clustering, reranking et classification zero-shot, entre autres. Cette diversité permet de comparer la capacité des modèles à produire des représentations utiles dans plusieurs contextes audio, monomodaux ou cross-modaux, et dans plus de 100 langues.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (communauté) |
| Capacités mesurées | Évaluation de la qualité des embeddings audio (parole, musique, sons environnementaux) et tâches audio-texte cross-modales |
| Modalité | audio,text |
| Type de questions | qualité des embeddings audio (retrieval, classification, clustering, reranking, zero-shot, etc.) |
| Métrique d'évaluation | métriques variables selon la tâche (NDCG, exactitude, etc.) |
| Accès | Public |
| Langues | plus de 100 langues |
| Taille du jeu | 30 tâches sélectionnées (dérivées de MAEB+, 98 tâches au total) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (21)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | LCO-Embedding/LCO-Embedding-Omni-7B | LCO-Embedding | 🟢 Ouvert | 53,5 % | 15 octobre 2025 | ✅ Mesuré |
| 2 | Haon-Chen/e5-omni-7B | Haon-Chen | 🟢 Ouvert | 52,5 % | 6 janvier 2026 | ✅ Mesuré |
| 3 | BidirLM/BidirLM-Omni-2.5B-Embedding | BidirLM | 🟢 Ouvert | 52,4 % | 7 avril 2026 | ✅ Mesuré |
| 4 | LCO-Embedding/LCO-Embedding-Omni-3B | LCO-Embedding | 🟢 Ouvert | 52,3 % | 23 octobre 2025 | ✅ Mesuré |
| 5 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 50,4 % | 1 avril 2026 | ✅ Mesuré |
| 6 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 50,1 % | 1 avril 2026 | ✅ Mesuré |
| 7 | Haon-Chen/e5-omni-3B | Haon-Chen | 🟢 Ouvert | 48,0 % | 6 janvier 2026 | ✅ Mesuré |
| 8 | Tevatron/OmniEmbed-v0.1 | Tevatron | 🟢 Ouvert | 43,9 % | 12 avril 2025 | ✅ Mesuré |
| 9 | laion/larger_clap_general | laion | 🟢 Ouvert | 35,0 % | 22 mai 2023 | ✅ Mesuré |
| 10 | laion/larger_clap_music_and_speech | laion | 🟢 Ouvert | 34,7 % | 22 mai 2023 | ✅ Mesuré |
| 11 | Qwen/Qwen2-Audio-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 34,5 % | 9 août 2024 | ✅ Mesuré |
| 12 | microsoft/msclap-2023 | Microsoft | 🟢 Ouvert | 34,0 % | 1 septembre 2023 | ✅ Mesuré |
| 13 | laion/clap-htsat-fused | laion | 🟢 Ouvert | 33,5 % | 22 mai 2023 | ✅ Mesuré |
| 14 | laion/clap-htsat-unfused | laion | 🟢 Ouvert | 33,0 % | 22 mai 2023 | ✅ Mesuré |
| 15 | encord-team/ebind-full | encord-team | 🟢 Ouvert | 32,8 % | 19 novembre 2025 | ✅ Mesuré |
| 16 | microsoft/msclap-2022 | Microsoft | 🟢 Ouvert | 32,2 % | 1 décembre 2022 | ✅ Mesuré |
| 17 | OpenMuQ/MuQ-MuLan-large | OpenMuQ | 🟢 Ouvert | 28,2 % | 1 janvier 2025 | ✅ Mesuré |
| 18 | lyrebird/wav2clip | lyrebird | 🟢 Ouvert | 26,6 % | 15 mars 2022 | ✅ Mesuré |
| 19 | microsoft/speecht5_multimodal | Microsoft | 🟢 Ouvert | 26,4 % | 16 mai 2022 | ✅ Mesuré |
| 20 | Qwen/Qwen2.5-Omni-3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 23,4 % | 30 avril 2025 | ✅ Mesuré |
| 21 | laion/larger_clap_music | laion | 🟢 Ouvert | 20,7 % | 22 mai 2023 | ✅ Mesuré |
Classement établi sur 21 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 34,5 %.
Notre analyse
Un score élevé indique qu’un modèle produit des embeddings performants sur un éventail de tâches, selon des métriques adaptées comme la NDCG ou l’exactitude. La comparaison doit néanmoins rester prudente, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment. Le benchmark est par ailleurs encore en bêta, dans l’attente d’une évaluation par les pairs.
Le niveau médian de 35 % et le meilleur score de 54 % suggèrent que le benchmark n’est pas saturé. Le classement fait ressortir LCO-Embedding/LCO-Embedding-Omni-7B, tout en montrant un écart substantiel entre la meilleure performance et le niveau central des modèles évalués. La portée reste celle des 30 tâches sélectionnées parmi les 98 tâches de MAEB+, malgré une couverture étendue des usages et des langues. Enfin, l’accès public impose de considérer le risque méthodologique de contamination lors de l’interprétation des scores, sans établir qu’une telle exposition a effectivement eu lieu.
Sources des scores : mteb.