MVEB Video-Text

MTEB: MVEB Video-Text est le sous-ensemble texte-vidéo de MVEB, créé par MTEB (embeddings-benchmark), El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des représentations conjointes du texte et de la vidéo produites par des modèles dépourvus…

MTEB: MVEB Video-Text est le sous-ensemble texte-vidéo de MVEB, créé par MTEB (embeddings-benchmark), El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des représentations conjointes du texte et de la vidéo produites par des modèles dépourvus d’encodeur audio.

Le benchmark couvre plusieurs usages complémentaires, notamment la récupération, la classification, le clustering, la classification par paires ou zero-shot et les questions-réponses centrées sur la vidéo. Cette diversité permet de comparer la capacité des embeddings à soutenir différents traitements multimodaux.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB (embeddings-benchmark) - El Assadi, Solomatin, Muennighoff, Enevoldsen et al.
Capacités mesuréesQualite des embeddings texte-video : recuperation, classification, clustering, pair/zero-shot classification et QA centree video, pour modeles sans encodeur audio
Modalitétext,video
Type de questionsEmbeddings texte-video (retrieval, classification, clustering, pair/zero-shot classification, QA video)
Métrique d'évaluationVariable selon la tache (NDCG, accuracy, etc.)
AccèsPublic
Languesprincipalement anglais
Taille du jeuSous-ensemble texte-video de MVEB (23 taches au total dans MVEB)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (23)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen/Qwen3-VL-Embedding-8BAlibaba Cloud / Qwen Team🟢 Ouvert60,9 %8 janvier 2026✅ Mesuré
2Qwen/Qwen3-VL-Embedding-2BAlibaba Cloud / Qwen Team🟢 Ouvert58,1 %8 janvier 2026✅ Mesuré
3LCO-Embedding/LCO-Embedding-Omni-7BLCO-Embedding🟢 Ouvert56,8 %15 octobre 2025✅ Mesuré
4LCO-Embedding/LCO-Embedding-Omni-3BLCO-Embedding🟢 Ouvert54,8 %23 octobre 2025✅ Mesuré
5Haon-Chen/e5-omni-7BHaon-Chen🟢 Ouvert54,1 %6 janvier 2026✅ Mesuré
6encord-team/ebind-points-visionencord-team🟢 Ouvert53,8 %19 novembre 2025✅ Mesuré
7encord-team/ebind-audio-visionencord-team🟢 Ouvert53,8 %19 novembre 2025✅ Mesuré
8encord-team/ebind-fullencord-team🟢 Ouvert53,8 %19 novembre 2025✅ Mesuré
9zhibinlan/UME-R1-7Bzhibinlan🟢 Ouvert53,3 %10 novembre 2025✅ Mesuré
10facebook/pe-av-largeMeta🟢 Ouvert52,4 %22 décembre 2025✅ Mesuré
11zhibinlan/UME-R1-2Bzhibinlan🟢 Ouvert51,5 %10 novembre 2025✅ Mesuré
12Tevatron/OmniEmbed-v0.1Tevatron🟢 Ouvert51,3 %12 avril 2025✅ Mesuré
13facebook/pe-av-smallMeta🟢 Ouvert50,2 %22 décembre 2025✅ Mesuré
14facebook/pe-av-baseMeta🟢 Ouvert49,7 %22 décembre 2025✅ Mesuré
15Haon-Chen/e5-omni-3BHaon-Chen🟢 Ouvert48,4 %6 janvier 2026✅ Mesuré
16jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert48,4 %1 avril 2026✅ Mesuré
17VLM2Vec/VLM2Vec-V2.0VLM2Vec🟢 Ouvert44,9 %30 avril 2025✅ Mesuré
18microsoft/xclip-large-patch14Microsoft🟢 Ouvert42,9 %4 août 2022✅ Mesuré
19microsoft/xclip-base-patch16Microsoft🟢 Ouvert38,4 %4 août 2022✅ Mesuré
20jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert37,0 %1 avril 2026✅ Mesuré
21microsoft/xclip-base-patch32Microsoft🟢 Ouvert35,9 %4 août 2022✅ Mesuré
22nvidia/omni-embed-nemotron-3bNVIDIA🟢 Ouvert35,8 %1 octobre 2025✅ Mesuré
23Qwen/Qwen2.5-Omni-3BAlibaba Cloud / Qwen Team🟢 Ouvert7,8 %30 avril 2025✅ Mesuré

Classement établi sur 23 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 51,3 %.

Notre analyse

Un score élevé sur MTEB: MVEB Video-Text traduit des embeddings texte-vidéo plus efficaces sur l’ensemble des tâches considérées. Son interprétation doit toutefois tenir compte de métriques variables selon les épreuves, comme NDCG ou accuracy. La diversité des 23 tâches de MVEB renforce la couverture fonctionnelle, mais la portée reste centrée sur le texte et la vidéo, principalement en anglais, pour des modèles sans encodeur audio.

La rigueur du classement est limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre entièrement indépendant. L’accès public peut aussi favoriser une exposition préalable au benchmark ou une optimisation ciblée, ce qui invite à considérer le risque de contamination dans l’interprétation. Les résultats ne montrent pas de saturation complète: Qwen/Qwen3-VL-Embedding-8B atteint 61 %, tandis que la médiane des 24 modèles évalués se situe à 51 %. Le classement met ainsi en évidence un avantage du modèle de Qwen, mais aussi un écart encore contenu entre le meilleur score et le niveau médian.


Sources des scores : mteb.