Image-Text, Multilingual
MTEB: Image-Text, Multilingual est un benchmark public consacré à la qualité des embeddings d’images et image-texte dans un contexte multilingue. Publié par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et al., il étend l’évaluation anglophone MIEB à des jeux…
MTEB: Image-Text, Multilingual est un benchmark public consacré à la qualité des embeddings d’images et image-texte dans un contexte multilingue. Publié par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et al., il étend l’évaluation anglophone MIEB à des jeux de retrieval multilingues.
Son périmètre couvre notamment la classification, le clustering, le retrieval, la compositionnalité, la compréhension de documents et le STS visuel. Cette diversité permet de comparer la capacité des modèles à produire des représentations utiles pour plusieurs usages de vision et de recherche sémantique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (équipe MIEB : Chenghao Xiao, Isaac Chung et al.) |
| Capacités mesurées | Qualité des embeddings d'images multilingues : classification (zero-shot et linear probing), clustering, retrieval, compositionnalité, compréhension de documents, STS visuel et tâches centrées vision |
| Modalité | image,text |
| Type de questions | Évaluation d'embeddings image/image-texte multilingue |
| Métrique d'évaluation | Métriques d'embedding selon la tâche (classification zero-shot, linear probing, clustering, retrieval, STS visuel) |
| Accès | Public |
| Licence | Apache-2.0 (code MTEB) |
| Langues | Multilingue (~38-39 langues) |
| Taille du jeu | 130 tâches, 8 catégories |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (40)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 65,1 % | 1 avril 2026 | ✅ Mesuré |
| 2 | voyageai/voyage-multimodal-3 | Voyage AI | 🟢 Ouvert | 63,8 % | 10 novembre 2024 | ✅ Mesuré |
| 3 | royokong/e5-v | royokong | 🟢 Ouvert | 58,2 % | 17 juillet 2024 | ✅ Mesuré |
| 4 | google/siglip-so400m-patch14-384 | 🟢 Ouvert | 57,1 % | 8 janvier 2024 | ✅ Mesuré | |
| 5 | google/siglip-large-patch16-384 | 🟢 Ouvert | 57,0 % | 8 janvier 2024 | ✅ Mesuré | |
| 6 | google/siglip-large-patch16-256 | 🟢 Ouvert | 55,2 % | 8 janvier 2024 | ✅ Mesuré | |
| 7 | google/siglip-base-patch16-512 | 🟢 Ouvert | 55,0 % | 8 janvier 2024 | ✅ Mesuré | |
| 8 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 54,5 % | 1 avril 2026 | ✅ Mesuré |
| 9 | laion/CLIP-ViT-bigG-14-laion2B-39B-b160k | laion | 🟢 Ouvert | 54,2 % | 23 janvier 2023 | ✅ Mesuré |
| 10 | google/siglip-base-patch16-384 | 🟢 Ouvert | 54,2 % | 8 janvier 2024 | ✅ Mesuré | |
| 11 | QuanSun/EVA02-CLIP-bigE-14-plus | QuanSun | 🟢 Ouvert | 53,5 % | 26 avril 2023 | ✅ Mesuré |
| 12 | laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 53,4 % | 26 avril 2023 | ✅ Mesuré |
| 13 | google/siglip-base-patch16-256-multilingual | 🟢 Ouvert | 53,1 % | 8 janvier 2024 | ✅ Mesuré | |
| 14 | laion/CLIP-ViT-H-14-laion2B-s32B-b79K | laion | 🟢 Ouvert | 52,7 % | 15 septembre 2022 | ✅ Mesuré |
| 15 | laion/CLIP-ViT-g-14-laion2B-s34B-b88K | laion | 🟢 Ouvert | 52,4 % | 6 mars 2023 | ✅ Mesuré |
| 16 | QuanSun/EVA02-CLIP-bigE-14 | QuanSun | 🟢 Ouvert | 52,2 % | 26 avril 2023 | ✅ Mesuré |
| 17 | google/siglip-base-patch16-256 | 🟢 Ouvert | 52,0 % | 8 janvier 2024 | ✅ Mesuré | |
| 18 | google/siglip-base-patch16-224 | 🟢 Ouvert | 50,9 % | 8 janvier 2024 | ✅ Mesuré | |
| 19 | laion/CLIP-ViT-L-14-laion2B-s32B-b82K | laion | 🟢 Ouvert | 50,6 % | 15 septembre 2022 | ✅ Mesuré |
| 20 | TIGER-Lab/VLM2Vec-LoRA | TIGER-Lab | 🟢 Ouvert | 50,5 % | 8 octobre 2024 | ✅ Mesuré |
| 21 | TIGER-Lab/VLM2Vec-Full | TIGER-Lab | 🟢 Ouvert | 50,4 % | 8 octobre 2024 | ✅ Mesuré |
| 22 | openai/clip-vit-large-patch14 | OpenAI | 🟢 Ouvert | 49,9 % | 26 février 2021 | ✅ Mesuré |
| 23 | laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 49,6 % | 26 avril 2023 | ✅ Mesuré |
| 24 | QuanSun/EVA02-CLIP-L-14 | QuanSun | 🟢 Ouvert | 47,3 % | 26 avril 2023 | ✅ Mesuré |
| 25 | openai/clip-vit-base-patch16 | OpenAI | 🟢 Ouvert | 46,2 % | 26 février 2021 | ✅ Mesuré |
| 26 | Salesforce/blip-itm-large-coco | Salesforce | 🟢 Ouvert | 45,9 % | 1 août 2023 | ✅ Mesuré |
| 27 | laion/CLIP-ViT-B-32-laion2B-s34B-b79K | laion | 🟢 Ouvert | 45,2 % | 15 septembre 2022 | ✅ Mesuré |
| 28 | jinaai/jina-clip-v1 | Jina AI | 🟢 Ouvert | 44,9 % | 30 mai 2024 | ✅ Mesuré |
| 29 | Salesforce/blip-itm-base-coco | Salesforce | 🟢 Ouvert | 44,7 % | 1 août 2023 | ✅ Mesuré |
| 30 | Salesforce/blip-itm-large-flickr | Salesforce | 🟢 Ouvert | 44,4 % | 1 août 2023 | ✅ Mesuré |
| 31 | laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 44,3 % | 26 avril 2023 | ✅ Mesuré |
| 32 | kakaobrain/align-base | kakaobrain | 🟢 Ouvert | 44,2 % | 24 février 2023 | ✅ Mesuré |
| 33 | BAAI/bge-visualized-m3 | BAAI | 🟢 Ouvert | 43,8 % | 6 juin 2024 | ✅ Mesuré |
| 34 | Salesforce/blip-itm-base-flickr | Salesforce | 🟢 Ouvert | 43,0 % | 1 août 2023 | ✅ Mesuré |
| 35 | BAAI/bge-visualized-base | BAAI | 🟢 Ouvert | 41,7 % | 6 juin 2024 | ✅ Mesuré |
| 36 | QuanSun/EVA02-CLIP-B-16 | QuanSun | 🟢 Ouvert | 41,5 % | 26 avril 2023 | ✅ Mesuré |
| 37 | openai/clip-vit-base-patch32 | OpenAI | 🟢 Ouvert | 41,4 % | 26 février 2021 | ✅ Mesuré |
| 38 | Salesforce/blip2-opt-2.7b | Salesforce | 🟢 Ouvert | 39,7 % | 22 mars 2024 | ✅ Mesuré |
| 39 | Salesforce/blip2-opt-6.7b-coco | Salesforce | 🟢 Ouvert | 39,6 % | 31 mars 2024 | ✅ Mesuré |
| 40 | nomic-ai/nomic-embed-vision-v1.5 | Nomic AI | 🟢 Ouvert | 39,3 % | 8 juin 2024 | ✅ Mesuré |
Classement établi sur 40 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 50,4 %.
Notre analyse
Un score élevé indique qu’un modèle produit des embeddings performants sur un ensemble varié de tâches image et image-texte, dans de nombreuses langues. Il synthétise toutefois des métriques propres à chaque catégorie, notamment la classification zero-shot, le linear probing, le clustering, le retrieval et le STS visuel. Il doit donc être interprété comme une mesure agrégée de polyvalence plutôt que comme une garantie uniforme sur chaque usage ou chaque langue.
La fiabilité du classement appelle une certaine prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que tous issus d’une mesure indépendante. Dans la base, jinaai/jina-embeddings-v5-omni-small atteint 65 %, contre une médiane de 50 % parmi les 40 modèles évalués. Cet écart montre que le benchmark conserve un pouvoir de différenciation et ne paraît pas entièrement saturé au sommet. Sa portée reste centrée sur la qualité des embeddings visuels multilingues couverte par ses 130 tâches. Le classement compare donc cette aptitude spécifique, sans constituer une mesure générale de toutes les capacités d’un modèle d’IA.
Sources des scores : mteb.