MVEB Video-Text
MTEB: MVEB Video-Text est le sous-ensemble texte-vidéo de MVEB, créé par MTEB (embeddings-benchmark), El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des représentations conjointes du texte et de la vidéo produites par des modèles dépourvus…
MTEB: MVEB Video-Text est le sous-ensemble texte-vidéo de MVEB, créé par MTEB (embeddings-benchmark), El Assadi, Solomatin, Muennighoff, Enevoldsen et leurs coauteurs. Il évalue la qualité des représentations conjointes du texte et de la vidéo produites par des modèles dépourvus d’encodeur audio.
Le benchmark couvre plusieurs usages complémentaires, notamment la récupération, la classification, le clustering, la classification par paires ou zero-shot et les questions-réponses centrées sur la vidéo. Cette diversité permet de comparer la capacité des embeddings à soutenir différents traitements multimodaux.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB (embeddings-benchmark) - El Assadi, Solomatin, Muennighoff, Enevoldsen et al. |
| Capacités mesurées | Qualite des embeddings texte-video : recuperation, classification, clustering, pair/zero-shot classification et QA centree video, pour modeles sans encodeur audio |
| Modalité | text,video |
| Type de questions | Embeddings texte-video (retrieval, classification, clustering, pair/zero-shot classification, QA video) |
| Métrique d'évaluation | Variable selon la tache (NDCG, accuracy, etc.) |
| Accès | Public |
| Langues | principalement anglais |
| Taille du jeu | Sous-ensemble texte-video de MVEB (23 taches au total dans MVEB) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen/Qwen3-VL-Embedding-8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,9 % | 8 janvier 2026 | ✅ Mesuré |
| 2 | Qwen/Qwen3-VL-Embedding-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,1 % | 8 janvier 2026 | ✅ Mesuré |
| 3 | LCO-Embedding/LCO-Embedding-Omni-7B | LCO-Embedding | 🟢 Ouvert | 56,8 % | 15 octobre 2025 | ✅ Mesuré |
| 4 | LCO-Embedding/LCO-Embedding-Omni-3B | LCO-Embedding | 🟢 Ouvert | 54,8 % | 23 octobre 2025 | ✅ Mesuré |
| 5 | Haon-Chen/e5-omni-7B | Haon-Chen | 🟢 Ouvert | 54,1 % | 6 janvier 2026 | ✅ Mesuré |
| 6 | encord-team/ebind-points-vision | encord-team | 🟢 Ouvert | 53,8 % | 19 novembre 2025 | ✅ Mesuré |
| 7 | encord-team/ebind-audio-vision | encord-team | 🟢 Ouvert | 53,8 % | 19 novembre 2025 | ✅ Mesuré |
| 8 | encord-team/ebind-full | encord-team | 🟢 Ouvert | 53,8 % | 19 novembre 2025 | ✅ Mesuré |
| 9 | zhibinlan/UME-R1-7B | zhibinlan | 🟢 Ouvert | 53,3 % | 10 novembre 2025 | ✅ Mesuré |
| 10 | facebook/pe-av-large | Meta | 🟢 Ouvert | 52,4 % | 22 décembre 2025 | ✅ Mesuré |
| 11 | zhibinlan/UME-R1-2B | zhibinlan | 🟢 Ouvert | 51,5 % | 10 novembre 2025 | ✅ Mesuré |
| 12 | Tevatron/OmniEmbed-v0.1 | Tevatron | 🟢 Ouvert | 51,3 % | 12 avril 2025 | ✅ Mesuré |
| 13 | facebook/pe-av-small | Meta | 🟢 Ouvert | 50,2 % | 22 décembre 2025 | ✅ Mesuré |
| 14 | facebook/pe-av-base | Meta | 🟢 Ouvert | 49,7 % | 22 décembre 2025 | ✅ Mesuré |
| 15 | Haon-Chen/e5-omni-3B | Haon-Chen | 🟢 Ouvert | 48,4 % | 6 janvier 2026 | ✅ Mesuré |
| 16 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 48,4 % | 1 avril 2026 | ✅ Mesuré |
| 17 | VLM2Vec/VLM2Vec-V2.0 | VLM2Vec | 🟢 Ouvert | 44,9 % | 30 avril 2025 | ✅ Mesuré |
| 18 | microsoft/xclip-large-patch14 | Microsoft | 🟢 Ouvert | 42,9 % | 4 août 2022 | ✅ Mesuré |
| 19 | microsoft/xclip-base-patch16 | Microsoft | 🟢 Ouvert | 38,4 % | 4 août 2022 | ✅ Mesuré |
| 20 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 37,0 % | 1 avril 2026 | ✅ Mesuré |
| 21 | microsoft/xclip-base-patch32 | Microsoft | 🟢 Ouvert | 35,9 % | 4 août 2022 | ✅ Mesuré |
| 22 | nvidia/omni-embed-nemotron-3b | NVIDIA | 🟢 Ouvert | 35,8 % | 1 octobre 2025 | ✅ Mesuré |
| 23 | Qwen/Qwen2.5-Omni-3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 7,8 % | 30 avril 2025 | ✅ Mesuré |
Classement établi sur 23 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 51,3 %.
Notre analyse
Un score élevé sur MTEB: MVEB Video-Text traduit des embeddings texte-vidéo plus efficaces sur l’ensemble des tâches considérées. Son interprétation doit toutefois tenir compte de métriques variables selon les épreuves, comme NDCG ou accuracy. La diversité des 23 tâches de MVEB renforce la couverture fonctionnelle, mais la portée reste centrée sur le texte et la vidéo, principalement en anglais, pour des modèles sans encodeur audio.
La rigueur du classement est limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre entièrement indépendant. L’accès public peut aussi favoriser une exposition préalable au benchmark ou une optimisation ciblée, ce qui invite à considérer le risque de contamination dans l’interprétation. Les résultats ne montrent pas de saturation complète: Qwen/Qwen3-VL-Embedding-8B atteint 61 %, tandis que la médiane des 24 modèles évalués se situe à 51 %. Le classement met ainsi en évidence un avantage du modèle de Qwen, mais aussi un écart encore contenu entre le meilleur score et le niveau médian.
Sources des scores : mteb.