MVEB Video-Only

MTEB: MVEB Video-Only est un benchmark créé par MTEB (embeddings-benchmark), avec El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des embeddings vidéo produits par des encodeurs dépourvus de composant textuel.

MTEB: MVEB Video-Only est un benchmark créé par MTEB (embeddings-benchmark), avec El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des embeddings vidéo produits par des encodeurs dépourvus de composant textuel.

L’évaluation couvre des tâches de classification et de pair classification issues du sous-ensemble vidéo seul de MVEB. En excluant la recherche d’information, les questions-réponses et les tâches zero-shot, qui nécessitent un encodeur de texte, ce benchmark sert à comparer plus spécifiquement la capacité des modèles à représenter le contenu vidéo.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB (embeddings-benchmark) - El Assadi, Solomatin, Muennighoff, Enevoldsen et al.
Capacités mesuréesQualite des embeddings video pour encodeurs sans composant texte : classification et pair classification
ModalitéVidéo
Type de questionsEmbeddings video (classification, pair classification)
Métrique d'évaluationVariable selon la tache (accuracy, etc.)
AccèsPublic
Languesnon linguistique / vidéo seule
Taille du jeuSous-ensemble video-seule de MVEB (23 taches au total dans MVEB)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (32)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen/Qwen3-VL-Embedding-8BAlibaba Cloud / Qwen Team🟢 Ouvert63,5 %8 janvier 2026✅ Mesuré
2Qwen/Qwen3-VL-Embedding-2BAlibaba Cloud / Qwen Team🟢 Ouvert62,3 %8 janvier 2026✅ Mesuré
3LCO-Embedding/LCO-Embedding-Omni-7BLCO-Embedding🟢 Ouvert61,7 %15 octobre 2025✅ Mesuré
4LCO-Embedding/LCO-Embedding-Omni-3BLCO-Embedding🟢 Ouvert61,6 %23 octobre 2025✅ Mesuré
5microsoft/xclip-large-patch14Microsoft🟢 Ouvert58,6 %4 août 2022✅ Mesuré
6BidirLM/BidirLM-Omni-2.5B-EmbeddingBidirLM🟢 Ouvert58,0 %7 avril 2026✅ Mesuré
7Tevatron/OmniEmbed-v0.1Tevatron🟢 Ouvert57,9 %12 avril 2025✅ Mesuré
8zhibinlan/UME-R1-7Bzhibinlan🟢 Ouvert57,5 %10 novembre 2025✅ Mesuré
9zhibinlan/UME-R1-2Bzhibinlan🟢 Ouvert57,4 %10 novembre 2025✅ Mesuré
10encord-team/ebind-points-visionencord-team🟢 Ouvert55,8 %19 novembre 2025✅ Mesuré
11encord-team/ebind-audio-visionencord-team🟢 Ouvert55,8 %19 novembre 2025✅ Mesuré
12encord-team/ebind-fullencord-team🟢 Ouvert55,8 %19 novembre 2025✅ Mesuré
13Haon-Chen/e5-omni-7BHaon-Chen🟢 Ouvert55,7 %6 janvier 2026✅ Mesuré
14Haon-Chen/e5-omni-3BHaon-Chen🟢 Ouvert55,7 %6 janvier 2026✅ Mesuré
15microsoft/xclip-base-patch16Microsoft🟢 Ouvert55,6 %4 août 2022✅ Mesuré
16facebook/pe-av-largeMeta🟢 Ouvert55,2 %22 décembre 2025✅ Mesuré
17jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert55,2 %1 avril 2026✅ Mesuré
18nvidia/omni-embed-nemotron-3bNVIDIA🟢 Ouvert54,7 %1 octobre 2025✅ Mesuré
19facebook/pe-av-baseMeta🟢 Ouvert53,8 %22 décembre 2025✅ Mesuré
20facebook/pe-av-smallMeta🟢 Ouvert53,3 %22 décembre 2025✅ Mesuré
21microsoft/xclip-base-patch32Microsoft🟢 Ouvert53,0 %4 août 2022✅ Mesuré
22VLM2Vec/VLM2Vec-V2.0VLM2Vec🟢 Ouvert52,9 %30 avril 2025✅ Mesuré
23jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert48,9 %1 avril 2026✅ Mesuré
24facebook/vjepa2-vitg-fpc32-384-diving48Meta🟢 Ouvert46,2 %13 juin 2025✅ Mesuré
25facebook/vjepa2-vitg-fpc64-256Meta🟢 Ouvert45,9 %11 juin 2025✅ Mesuré
26facebook/vjepa2-vitg-fpc64-384Meta🟢 Ouvert45,6 %11 juin 2025✅ Mesuré
27facebook/vjepa2-vitg-fpc64-384-ssv2Meta🟢 Ouvert45,6 %13 juin 2025✅ Mesuré
28facebook/vjepa2-vitl-fpc64-256Meta🟢 Ouvert45,2 %11 juin 2025✅ Mesuré
29facebook/vjepa2-vitl-fpc32-256-diving48Meta🟢 Ouvert44,8 %13 juin 2025✅ Mesuré
30facebook/vjepa2-vitl-fpc16-256-ssv2Meta🟢 Ouvert44,6 %13 juin 2025✅ Mesuré
31facebook/vjepa2-vith-fpc64-256Meta🟢 Ouvert42,5 %11 juin 2025✅ Mesuré
32Qwen/Qwen2.5-Omni-3BAlibaba Cloud / Qwen Team🟢 Ouvert30,1 %30 avril 2025✅ Mesuré

Classement établi sur 32 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 55,2 %.

Notre analyse

Un score élevé indique que les embeddings vidéo permettent de mieux réussir les tâches de classification et de pair classification retenues, selon la métrique propre à chacune, notamment l’accuracy. Le classement place Qwen/Qwen3-VL-Embedding-8B en tête à 64 %, contre une médiane de 55 % parmi les 33 modèles évalués dans la base. Cet écart montre un avantage mesurable du premier modèle sur le niveau central de l’ensemble, sans résumer à lui seul les performances tâche par tâche.

La rigueur de la comparaison doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure uniforme par un tiers. Le caractère public du benchmark invite aussi à garder à l’esprit le risque de contamination dans l’interprétation des résultats. La portée reste volontairement circonscrite aux encodeurs sans composant texte et aux usages vidéo de classification. Les tâches nécessitant du texte étant exclues, le classement ne mesure ni la recherche d’information, ni les questions-réponses, ni le zero-shot. La médiane et le meilleur score ne suffisent donc pas à conclure à une saturation générale du benchmark.


Sources des scores : mteb.