MVEB
MTEB: MVEB est un benchmark public du projet MTEB / embeddings-benchmark, créé par El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs collaborateurs. Il évalue la qualité des embeddings vidéo audio-visuels, c’est-à-dire la représentation conjointe des informations visuelles et…
MTEB: MVEB est un benchmark public du projet MTEB / embeddings-benchmark, créé par El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs collaborateurs. Il évalue la qualité des embeddings vidéo audio-visuels, c’est-à-dire la représentation conjointe des informations visuelles et sonores par les modèles.
Son périmètre couvre le retrieval, la classification, le clustering, la pair classification, la classification zero-shot et la QA centrée sur la vidéo. La sélection des tâches vise une large couverture des entrées combinant audio et vidéo, afin de comparer les modèles sur plusieurs usages complémentaires.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Projet MTEB / embeddings-benchmark (El Assadi, Solomatin, … Muennighoff, Enevoldsen) |
| Capacités mesurées | Qualité des embeddings vidéo audio-visuels sur retrieval, classification, clustering, pair classification, classification zero-shot et QA centrée vidéo. |
| Modalité | audio,text,video |
| Type de questions | Embedding vidéo audio-visuel (retrieval, classification, clustering, pair classification, zero-shot, QA vidéo) |
| Métrique d'évaluation | Score dépendant de la tâche, agrégé |
| Accès | Public |
| Langues | principalement anglais |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | LCO-Embedding/LCO-Embedding-Omni-7B | LCO-Embedding | 🟢 Ouvert | 57,6 % | 15 octobre 2025 | ✅ Mesuré |
| 2 | encord-team/ebind-audio-vision | encord-team | 🟢 Ouvert | 55,5 % | 19 novembre 2025 | ✅ Mesuré |
| 3 | encord-team/ebind-full | encord-team | 🟢 Ouvert | 55,5 % | 19 novembre 2025 | ✅ Mesuré |
| 4 | Haon-Chen/e5-omni-7B | Haon-Chen | 🟢 Ouvert | 55,0 % | 6 janvier 2026 | ✅ Mesuré |
| 5 | LCO-Embedding/LCO-Embedding-Omni-3B | LCO-Embedding | 🟢 Ouvert | 54,6 % | 23 octobre 2025 | ✅ Mesuré |
| 6 | facebook/pe-av-large | Meta | 🟢 Ouvert | 54,3 % | 22 décembre 2025 | ✅ Mesuré |
| 7 | facebook/pe-av-base | Meta | 🟢 Ouvert | 53,1 % | 22 décembre 2025 | ✅ Mesuré |
| 8 | Tevatron/OmniEmbed-v0.1 | Tevatron | 🟢 Ouvert | 52,9 % | 12 avril 2025 | ✅ Mesuré |
| 9 | facebook/pe-av-small | Meta | 🟢 Ouvert | 52,2 % | 22 décembre 2025 | ✅ Mesuré |
| 10 | BidirLM/BidirLM-Omni-2.5B-Embedding | BidirLM | 🟢 Ouvert | 51,2 % | 7 avril 2026 | ✅ Mesuré |
| 11 | Haon-Chen/e5-omni-3B | Haon-Chen | 🟢 Ouvert | 48,5 % | 6 janvier 2026 | ✅ Mesuré |
| 12 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 45,5 % | 1 avril 2026 | ✅ Mesuré |
| 13 | nvidia/omni-embed-nemotron-3b | NVIDIA | 🟢 Ouvert | 42,8 % | 1 octobre 2025 | ✅ Mesuré |
| 14 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 36,2 % | 1 avril 2026 | ✅ Mesuré |
| 15 | Qwen/Qwen2.5-Omni-3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 11,4 % | 30 avril 2025 | ✅ Mesuré |
Classement établi sur 15 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 52,9 %.
Notre analyse
Un score élevé indique une meilleure qualité agrégée des embeddings sur les différentes familles de tâches, selon une métrique adaptée à chacune. Il reflète donc une performance transversale plutôt qu’une aptitude isolée. La médiane de 53 % et le meilleur résultat de 58 %, obtenu par LCO-Embedding/LCO-Embedding-Omni-7B, montrent un écart limité de cinq points entre le centre du groupe et la première place. Cette proximité peut signaler une différenciation modérée du classement, mais ne suffit pas, à elle seule, à établir une saturation du benchmark.
La rigueur comparative doit être appréciée avec prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que tous issus d’une mesure indépendante uniforme. Le caractère public du benchmark crée aussi un risque d’exposition des tâches, susceptible de favoriser une adaptation ciblée et de réduire la portée du classement comme mesure de généralisation. Enfin, son champ reste centré sur les embeddings audio-visuels et sur des tâches principalement en anglais. Parmi les 16 modèles recensés, le classement distingue LCO-Embedding/LCO-Embedding-Omni-7B, tout en faisant apparaître un ensemble de performances relativement resserré.
Sources des scores : mteb.