Image-Text, English
MTEB: Image-Text, English est un benchmark consacré à la qualité des embeddings d’images et d’ensembles image-texte en anglais. Il a été créé par MTEB / embeddings-benchmark, dans le cadre des travaux de l’équipe MIEB menée par Chenghao Xiao, Isaac Chung et leurs collaborateurs.
MTEB: Image-Text, English est un benchmark consacré à la qualité des embeddings d’images et d’ensembles image-texte en anglais. Il a été créé par MTEB / embeddings-benchmark, dans le cadre des travaux de l’équipe MIEB menée par Chenghao Xiao, Isaac Chung et leurs collaborateurs.
Son évaluation couvre plusieurs usages complémentaires, notamment la classification zero-shot et par linear probing, le clustering, le retrieval, la compositionnalité, la compréhension de documents, le STS visuel et des tâches centrées sur la vision. Cette diversité permet de comparer la polyvalence des modèles d’embeddings au-delà d’un scénario unique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (équipe MIEB : Chenghao Xiao, Isaac Chung et al.) |
| Capacités mesurées | Qualité des embeddings d'images en anglais : classification (zero-shot et linear probing), clustering, retrieval, évaluation de compositionnalité, compréhension de documents, STS visuel et tâches centrées vision (CV) |
| Modalité | image,text |
| Type de questions | Évaluation d'embeddings image/image-texte en anglais |
| Métrique d'évaluation | Métriques d'embedding selon la tâche (classification zero-shot, linear probing, clustering, retrieval, STS visuel) |
| Accès | Public |
| Licence | Apache-2.0 (code MTEB) |
| Langues | Anglais |
| Taille du jeu | Sous-ensemble anglais des 130 tâches MIEB |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (40)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 65,3 % | 1 avril 2026 | ✅ Mesuré |
| 2 | voyageai/voyage-multimodal-3 | Voyage AI | 🟢 Ouvert | 63,6 % | 10 novembre 2024 | ✅ Mesuré |
| 3 | google/siglip-so400m-patch14-384 | 🟢 Ouvert | 61,2 % | 8 janvier 2024 | ✅ Mesuré | |
| 4 | laion/CLIP-ViT-bigG-14-laion2B-39B-b160k | laion | 🟢 Ouvert | 60,0 % | 23 janvier 2023 | ✅ Mesuré |
| 5 | google/siglip-large-patch16-384 | 🟢 Ouvert | 59,9 % | 8 janvier 2024 | ✅ Mesuré | |
| 6 | QuanSun/EVA02-CLIP-bigE-14-plus | QuanSun | 🟢 Ouvert | 59,8 % | 26 avril 2023 | ✅ Mesuré |
| 7 | laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 59,4 % | 26 avril 2023 | ✅ Mesuré |
| 8 | royokong/e5-v | royokong | 🟢 Ouvert | 58,6 % | 17 juillet 2024 | ✅ Mesuré |
| 9 | QuanSun/EVA02-CLIP-bigE-14 | QuanSun | 🟢 Ouvert | 58,6 % | 26 avril 2023 | ✅ Mesuré |
| 10 | google/siglip-base-patch16-512 | 🟢 Ouvert | 58,5 % | 8 janvier 2024 | ✅ Mesuré | |
| 11 | laion/CLIP-ViT-H-14-laion2B-s32B-b79K | laion | 🟢 Ouvert | 58,4 % | 15 septembre 2022 | ✅ Mesuré |
| 12 | laion/CLIP-ViT-g-14-laion2B-s34B-b88K | laion | 🟢 Ouvert | 58,3 % | 6 mars 2023 | ✅ Mesuré |
| 13 | google/siglip-large-patch16-256 | 🟢 Ouvert | 57,9 % | 8 janvier 2024 | ✅ Mesuré | |
| 14 | google/siglip-base-patch16-384 | 🟢 Ouvert | 57,8 % | 8 janvier 2024 | ✅ Mesuré | |
| 15 | laion/CLIP-ViT-L-14-laion2B-s32B-b82K | laion | 🟢 Ouvert | 57,2 % | 15 septembre 2022 | ✅ Mesuré |
| 16 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 55,8 % | 1 avril 2026 | ✅ Mesuré |
| 17 | laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 55,8 % | 26 avril 2023 | ✅ Mesuré |
| 18 | google/siglip-base-patch16-256 | 🟢 Ouvert | 55,5 % | 8 janvier 2024 | ✅ Mesuré | |
| 19 | openai/clip-vit-large-patch14 | OpenAI | 🟢 Ouvert | 55,4 % | 26 février 2021 | ✅ Mesuré |
| 20 | google/siglip-base-patch16-224 | 🟢 Ouvert | 54,3 % | 8 janvier 2024 | ✅ Mesuré | |
| 21 | google/siglip-base-patch16-256-multilingual | 🟢 Ouvert | 53,9 % | 8 janvier 2024 | ✅ Mesuré | |
| 22 | TIGER-Lab/VLM2Vec-LoRA | TIGER-Lab | 🟢 Ouvert | 53,4 % | 8 octobre 2024 | ✅ Mesuré |
| 23 | QuanSun/EVA02-CLIP-L-14 | QuanSun | 🟢 Ouvert | 53,4 % | 26 avril 2023 | ✅ Mesuré |
| 24 | TIGER-Lab/VLM2Vec-Full | TIGER-Lab | 🟢 Ouvert | 53,3 % | 8 octobre 2024 | ✅ Mesuré |
| 25 | openai/clip-vit-base-patch16 | OpenAI | 🟢 Ouvert | 51,8 % | 26 février 2021 | ✅ Mesuré |
| 26 | Salesforce/blip-itm-large-coco | Salesforce | 🟢 Ouvert | 50,9 % | 1 août 2023 | ✅ Mesuré |
| 27 | laion/CLIP-ViT-B-32-laion2B-s34B-b79K | laion | 🟢 Ouvert | 50,7 % | 15 septembre 2022 | ✅ Mesuré |
| 28 | laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 49,9 % | 26 avril 2023 | ✅ Mesuré |
| 29 | jinaai/jina-clip-v1 | Jina AI | 🟢 Ouvert | 49,5 % | 30 mai 2024 | ✅ Mesuré |
| 30 | Salesforce/blip-itm-large-flickr | Salesforce | 🟢 Ouvert | 49,5 % | 1 août 2023 | ✅ Mesuré |
| 31 | kakaobrain/align-base | kakaobrain | 🟢 Ouvert | 49,1 % | 24 février 2023 | ✅ Mesuré |
| 32 | Salesforce/blip-itm-base-coco | Salesforce | 🟢 Ouvert | 48,9 % | 1 août 2023 | ✅ Mesuré |
| 33 | BAAI/bge-visualized-base | BAAI | 🟢 Ouvert | 47,4 % | 6 juin 2024 | ✅ Mesuré |
| 34 | Salesforce/blip-itm-base-flickr | Salesforce | 🟢 Ouvert | 47,3 % | 1 août 2023 | ✅ Mesuré |
| 35 | openai/clip-vit-base-patch32 | OpenAI | 🟢 Ouvert | 47,0 % | 26 février 2021 | ✅ Mesuré |
| 36 | QuanSun/EVA02-CLIP-B-16 | QuanSun | 🟢 Ouvert | 46,5 % | 26 avril 2023 | ✅ Mesuré |
| 37 | BAAI/bge-visualized-m3 | BAAI | 🟢 Ouvert | 46,0 % | 6 juin 2024 | ✅ Mesuré |
| 38 | nomic-ai/nomic-embed-vision-v1.5 | Nomic AI | 🟢 Ouvert | 45,5 % | 8 juin 2024 | ✅ Mesuré |
| 39 | Salesforce/blip2-opt-2.7b | Salesforce | 🟢 Ouvert | 45,2 % | 22 mars 2024 | ✅ Mesuré |
| 40 | Salesforce/blip2-opt-6.7b-coco | Salesforce | 🟢 Ouvert | 45,1 % | 31 mars 2024 | ✅ Mesuré |
Classement établi sur 40 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 54,1 %.
Notre analyse
Un score élevé indique qu’un modèle produit des représentations efficaces sur un ensemble varié de tâches visuelles et multimodales en anglais. Il reflète donc une qualité globale, combinant notamment classification, regroupement, recherche et mesure de similarité, plutôt qu’une aptitude isolée.
La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Leur niveau de contrôle n’est donc pas équivalent à celui de résultats systématiquement mesurés de manière indépendante. La contamination constitue également un point de vigilance pour un benchmark public, tandis que sa portée reste circonscrite aux embeddings d’images et image-texte en anglais.
Parmi les 40 modèles évalués dans la base, jinaai/jina-embeddings-v5-omni-small arrive en tête avec 65 %, contre une médiane de 54 %. Cet écart de 11 points met en évidence une avance mesurable du meilleur modèle sur le centre de la distribution. Le score maximal observé reste éloigné d’un plafond parfait, ce qui ne suggère pas une saturation complète du benchmark. Le classement renseigne surtout sur la polyvalence relative des modèles dans le périmètre précis de MTEB: Image-Text, English.
Sources des scores : mteb.