MVEB Video-Only
MTEB: MVEB Video-Only est un benchmark créé par MTEB (embeddings-benchmark), avec El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des embeddings vidéo produits par des encodeurs dépourvus de composant textuel.
MTEB: MVEB Video-Only est un benchmark créé par MTEB (embeddings-benchmark), avec El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des embeddings vidéo produits par des encodeurs dépourvus de composant textuel.
L’évaluation couvre des tâches de classification et de pair classification issues du sous-ensemble vidéo seul de MVEB. En excluant la recherche d’information, les questions-réponses et les tâches zero-shot, qui nécessitent un encodeur de texte, ce benchmark sert à comparer plus spécifiquement la capacité des modèles à représenter le contenu vidéo.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB (embeddings-benchmark) - El Assadi, Solomatin, Muennighoff, Enevoldsen et al. |
| Capacités mesurées | Qualite des embeddings video pour encodeurs sans composant texte : classification et pair classification |
| Modalité | Vidéo |
| Type de questions | Embeddings video (classification, pair classification) |
| Métrique d'évaluation | Variable selon la tache (accuracy, etc.) |
| Accès | Public |
| Langues | non linguistique / vidéo seule |
| Taille du jeu | Sous-ensemble video-seule de MVEB (23 taches au total dans MVEB) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (32)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen/Qwen3-VL-Embedding-8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,5 % | 8 janvier 2026 | ✅ Mesuré |
| 2 | Qwen/Qwen3-VL-Embedding-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,3 % | 8 janvier 2026 | ✅ Mesuré |
| 3 | LCO-Embedding/LCO-Embedding-Omni-7B | LCO-Embedding | 🟢 Ouvert | 61,7 % | 15 octobre 2025 | ✅ Mesuré |
| 4 | LCO-Embedding/LCO-Embedding-Omni-3B | LCO-Embedding | 🟢 Ouvert | 61,6 % | 23 octobre 2025 | ✅ Mesuré |
| 5 | microsoft/xclip-large-patch14 | Microsoft | 🟢 Ouvert | 58,6 % | 4 août 2022 | ✅ Mesuré |
| 6 | BidirLM/BidirLM-Omni-2.5B-Embedding | BidirLM | 🟢 Ouvert | 58,0 % | 7 avril 2026 | ✅ Mesuré |
| 7 | Tevatron/OmniEmbed-v0.1 | Tevatron | 🟢 Ouvert | 57,9 % | 12 avril 2025 | ✅ Mesuré |
| 8 | zhibinlan/UME-R1-7B | zhibinlan | 🟢 Ouvert | 57,5 % | 10 novembre 2025 | ✅ Mesuré |
| 9 | zhibinlan/UME-R1-2B | zhibinlan | 🟢 Ouvert | 57,4 % | 10 novembre 2025 | ✅ Mesuré |
| 10 | encord-team/ebind-points-vision | encord-team | 🟢 Ouvert | 55,8 % | 19 novembre 2025 | ✅ Mesuré |
| 11 | encord-team/ebind-audio-vision | encord-team | 🟢 Ouvert | 55,8 % | 19 novembre 2025 | ✅ Mesuré |
| 12 | encord-team/ebind-full | encord-team | 🟢 Ouvert | 55,8 % | 19 novembre 2025 | ✅ Mesuré |
| 13 | Haon-Chen/e5-omni-7B | Haon-Chen | 🟢 Ouvert | 55,7 % | 6 janvier 2026 | ✅ Mesuré |
| 14 | Haon-Chen/e5-omni-3B | Haon-Chen | 🟢 Ouvert | 55,7 % | 6 janvier 2026 | ✅ Mesuré |
| 15 | microsoft/xclip-base-patch16 | Microsoft | 🟢 Ouvert | 55,6 % | 4 août 2022 | ✅ Mesuré |
| 16 | facebook/pe-av-large | Meta | 🟢 Ouvert | 55,2 % | 22 décembre 2025 | ✅ Mesuré |
| 17 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 55,2 % | 1 avril 2026 | ✅ Mesuré |
| 18 | nvidia/omni-embed-nemotron-3b | NVIDIA | 🟢 Ouvert | 54,7 % | 1 octobre 2025 | ✅ Mesuré |
| 19 | facebook/pe-av-base | Meta | 🟢 Ouvert | 53,8 % | 22 décembre 2025 | ✅ Mesuré |
| 20 | facebook/pe-av-small | Meta | 🟢 Ouvert | 53,3 % | 22 décembre 2025 | ✅ Mesuré |
| 21 | microsoft/xclip-base-patch32 | Microsoft | 🟢 Ouvert | 53,0 % | 4 août 2022 | ✅ Mesuré |
| 22 | VLM2Vec/VLM2Vec-V2.0 | VLM2Vec | 🟢 Ouvert | 52,9 % | 30 avril 2025 | ✅ Mesuré |
| 23 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 48,9 % | 1 avril 2026 | ✅ Mesuré |
| 24 | facebook/vjepa2-vitg-fpc32-384-diving48 | Meta | 🟢 Ouvert | 46,2 % | 13 juin 2025 | ✅ Mesuré |
| 25 | facebook/vjepa2-vitg-fpc64-256 | Meta | 🟢 Ouvert | 45,9 % | 11 juin 2025 | ✅ Mesuré |
| 26 | facebook/vjepa2-vitg-fpc64-384 | Meta | 🟢 Ouvert | 45,6 % | 11 juin 2025 | ✅ Mesuré |
| 27 | facebook/vjepa2-vitg-fpc64-384-ssv2 | Meta | 🟢 Ouvert | 45,6 % | 13 juin 2025 | ✅ Mesuré |
| 28 | facebook/vjepa2-vitl-fpc64-256 | Meta | 🟢 Ouvert | 45,2 % | 11 juin 2025 | ✅ Mesuré |
| 29 | facebook/vjepa2-vitl-fpc32-256-diving48 | Meta | 🟢 Ouvert | 44,8 % | 13 juin 2025 | ✅ Mesuré |
| 30 | facebook/vjepa2-vitl-fpc16-256-ssv2 | Meta | 🟢 Ouvert | 44,6 % | 13 juin 2025 | ✅ Mesuré |
| 31 | facebook/vjepa2-vith-fpc64-256 | Meta | 🟢 Ouvert | 42,5 % | 11 juin 2025 | ✅ Mesuré |
| 32 | Qwen/Qwen2.5-Omni-3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 30,1 % | 30 avril 2025 | ✅ Mesuré |
Classement établi sur 32 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 55,2 %.
Notre analyse
Un score élevé indique que les embeddings vidéo permettent de mieux réussir les tâches de classification et de pair classification retenues, selon la métrique propre à chacune, notamment l’accuracy. Le classement place Qwen/Qwen3-VL-Embedding-8B en tête à 64 %, contre une médiane de 55 % parmi les 33 modèles évalués dans la base. Cet écart montre un avantage mesurable du premier modèle sur le niveau central de l’ensemble, sans résumer à lui seul les performances tâche par tâche.
La rigueur de la comparaison doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure uniforme par un tiers. Le caractère public du benchmark invite aussi à garder à l’esprit le risque de contamination dans l’interprétation des résultats. La portée reste volontairement circonscrite aux encodeurs sans composant texte et aux usages vidéo de classification. Les tâches nécessitant du texte étant exclues, le classement ne mesure ni la recherche d’information, ni les questions-réponses, ni le zero-shot. La médiane et le meilleur score ne suffisent donc pas à conclure à une saturation générale du benchmark.
Sources des scores : mteb.