Image only
MTEB: Image only est un benchmark consacré à la qualité des embeddings purement visuels. Publié en 2025 par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et leurs coauteurs, il repose sur un sous-ensemble de tâches MIEB ne nécessitant aucun encodeur de texte.
MTEB: Image only est un benchmark consacré à la qualité des embeddings purement visuels. Publié en 2025 par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et leurs coauteurs, il repose sur un sous-ensemble de tâches MIEB ne nécessitant aucun encodeur de texte.
Il évalue la représentation des images à travers la recherche, la classification, le clustering et la similarité sémantique visuelle. Son rôle est de comparer la capacité des modèles à produire des embeddings utiles dans plusieurs types de traitements fondés uniquement sur l’image.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (équipe MIEB : Chenghao Xiao, Isaac Chung et al.) |
| Capacités mesurées | Qualité des embeddings purement visuels : retrieval, classification, clustering et STS visuel |
| Modalité | Image |
| Type de questions | Évaluation d'embeddings d'images (tâches n'exigeant pas d'encodeur de texte) |
| Métrique d'évaluation | Métriques d'embedding selon la tâche (retrieval, classification, clustering, STS visuel) |
| Accès | Public |
| Licence | Apache-2.0 (code MTEB) |
| Langues | Sans objet (tâches purement image) |
| Taille du jeu | Sous-ensemble des tâches MIEB excluant celles requérant un encodeur de texte |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (45)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 69,1 % | 1 avril 2026 | ✅ Mesuré |
| 2 | voyageai/voyage-multimodal-3 | Voyage AI | 🟢 Ouvert | 67,3 % | 10 novembre 2024 | ✅ Mesuré |
| 3 | QuanSun/EVA02-CLIP-bigE-14-plus | QuanSun | 🟢 Ouvert | 65,2 % | 26 avril 2023 | ✅ Mesuré |
| 4 | google/siglip-so400m-patch14-384 | 🟢 Ouvert | 64,2 % | 8 janvier 2024 | ✅ Mesuré | |
| 5 | laion/CLIP-ViT-bigG-14-laion2B-39B-b160k | laion | 🟢 Ouvert | 64,0 % | 23 janvier 2023 | ✅ Mesuré |
| 6 | laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 63,6 % | 26 avril 2023 | ✅ Mesuré |
| 7 | google/siglip-large-patch16-384 | 🟢 Ouvert | 63,5 % | 8 janvier 2024 | ✅ Mesuré | |
| 8 | QuanSun/EVA02-CLIP-bigE-14 | QuanSun | 🟢 Ouvert | 63,5 % | 26 avril 2023 | ✅ Mesuré |
| 9 | google/siglip-large-patch16-256 | 🟢 Ouvert | 62,6 % | 8 janvier 2024 | ✅ Mesuré | |
| 10 | laion/CLIP-ViT-H-14-laion2B-s32B-b79K | laion | 🟢 Ouvert | 61,9 % | 15 septembre 2022 | ✅ Mesuré |
| 11 | laion/CLIP-ViT-g-14-laion2B-s34B-b88K | laion | 🟢 Ouvert | 61,9 % | 6 mars 2023 | ✅ Mesuré |
| 12 | google/siglip-base-patch16-512 | 🟢 Ouvert | 60,9 % | 8 janvier 2024 | ✅ Mesuré | |
| 13 | google/siglip-base-patch16-384 | 🟢 Ouvert | 60,8 % | 8 janvier 2024 | ✅ Mesuré | |
| 14 | royokong/e5-v | royokong | 🟢 Ouvert | 60,4 % | 17 juillet 2024 | ✅ Mesuré |
| 15 | laion/CLIP-ViT-L-14-laion2B-s32B-b82K | laion | 🟢 Ouvert | 59,9 % | 15 septembre 2022 | ✅ Mesuré |
| 16 | google/siglip-base-patch16-256-multilingual | 🟢 Ouvert | 59,9 % | 8 janvier 2024 | ✅ Mesuré | |
| 17 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 59,7 % | 1 avril 2026 | ✅ Mesuré |
| 18 | laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 59,7 % | 26 avril 2023 | ✅ Mesuré |
| 19 | google/siglip-base-patch16-256 | 🟢 Ouvert | 59,5 % | 8 janvier 2024 | ✅ Mesuré | |
| 20 | openai/clip-vit-large-patch14 | OpenAI | 🟢 Ouvert | 59,2 % | 26 février 2021 | ✅ Mesuré |
| 21 | google/siglip-base-patch16-224 | 🟢 Ouvert | 58,6 % | 8 janvier 2024 | ✅ Mesuré | |
| 22 | QuanSun/EVA02-CLIP-L-14 | QuanSun | 🟢 Ouvert | 56,8 % | 26 avril 2023 | ✅ Mesuré |
| 23 | Salesforce/blip-itm-large-coco | Salesforce | 🟢 Ouvert | 56,3 % | 1 août 2023 | ✅ Mesuré |
| 24 | TIGER-Lab/VLM2Vec-LoRA | TIGER-Lab | 🟢 Ouvert | 56,1 % | 8 octobre 2024 | ✅ Mesuré |
| 25 | TIGER-Lab/VLM2Vec-Full | TIGER-Lab | 🟢 Ouvert | 55,7 % | 8 octobre 2024 | ✅ Mesuré |
| 26 | Salesforce/blip-itm-base-coco | Salesforce | 🟢 Ouvert | 55,7 % | 1 août 2023 | ✅ Mesuré |
| 27 | laion/CLIP-ViT-B-32-laion2B-s34B-b79K | laion | 🟢 Ouvert | 55,2 % | 15 septembre 2022 | ✅ Mesuré |
| 28 | openai/clip-vit-base-patch16 | OpenAI | 🟢 Ouvert | 55,1 % | 26 février 2021 | ✅ Mesuré |
| 29 | Salesforce/blip-itm-large-flickr | Salesforce | 🟢 Ouvert | 54,5 % | 1 août 2023 | ✅ Mesuré |
| 30 | jinaai/jina-clip-v1 | Jina AI | 🟢 Ouvert | 54,1 % | 30 mai 2024 | ✅ Mesuré |
| 31 | laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90K | laion | 🟢 Ouvert | 53,9 % | 26 avril 2023 | ✅ Mesuré |
| 32 | Salesforce/blip-itm-base-flickr | Salesforce | 🟢 Ouvert | 53,6 % | 1 août 2023 | ✅ Mesuré |
| 33 | BAAI/bge-visualized-base | BAAI | 🟢 Ouvert | 53,1 % | 6 juin 2024 | ✅ Mesuré |
| 34 | BAAI/bge-visualized-m3 | BAAI | 🟢 Ouvert | 52,4 % | 6 juin 2024 | ✅ Mesuré |
| 35 | kakaobrain/align-base | kakaobrain | 🟢 Ouvert | 50,9 % | 24 février 2023 | ✅ Mesuré |
| 36 | openai/clip-vit-base-patch32 | OpenAI | 🟢 Ouvert | 49,0 % | 26 février 2021 | ✅ Mesuré |
| 37 | Salesforce/blip2-opt-2.7b | Salesforce | 🟢 Ouvert | 48,5 % | 22 mars 2024 | ✅ Mesuré |
| 38 | QuanSun/EVA02-CLIP-B-16 | QuanSun | 🟢 Ouvert | 48,1 % | 26 avril 2023 | ✅ Mesuré |
| 39 | Salesforce/blip2-opt-6.7b-coco | Salesforce | 🟢 Ouvert | 47,6 % | 31 mars 2024 | ✅ Mesuré |
| 40 | facebook/dinov2-giant | Meta | 🟢 Ouvert | 46,3 % | 18 juillet 2023 | ✅ Mesuré |
| 41 | facebook/dinov2-large | Meta | 🟢 Ouvert | 46,2 % | 18 juillet 2023 | ✅ Mesuré |
| 42 | facebook/dinov2-base | Meta | 🟢 Ouvert | 45,9 % | 18 juillet 2023 | ✅ Mesuré |
| 43 | nomic-ai/nomic-embed-vision-v1.5 | Nomic AI | 🟢 Ouvert | 45,4 % | 8 juin 2024 | ✅ Mesuré |
| 44 | facebook/dinov2-small | Meta | 🟢 Ouvert | 43,1 % | 18 juillet 2023 | ✅ Mesuré |
| 45 | nyu-visionx/moco-v3-vit-b | nyu-visionx | 🟢 Ouvert | 37,5 % | 3 juin 2024 | ✅ Mesuré |
Classement établi sur 45 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 56,3 %.
Notre analyse
Un score élevé indique qu’un modèle produit des représentations visuelles efficaces sur plusieurs familles de tâches, selon les métriques propres à la recherche, à la classification, au clustering et au STS visuel. Il ne correspond donc pas à une capacité unique, mais à une qualité agrégée d’embeddings d’images. La fiabilité du classement doit toutefois être nuancée, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que tous mesurés dans un cadre indépendant uniforme.
Avec 45 modèles évalués, une médiane de 56 % et un meilleur résultat de 69 % pour jinaai/jina-embeddings-v5-omni-small de Jina AI, le classement fait apparaître un écart notable entre le niveau central et la tête. Ces valeurs ne suggèrent pas une saturation complète du benchmark. Sa portée reste volontairement ciblée sur les tâches purement visuelles du sous-ensemble MIEB. Il mesure ainsi la qualité des embeddings d’images, mais exclut explicitement les tâches nécessitant un encodeur de texte. Le classement doit être interprété dans ce périmètre précis, sans l’étendre aux capacités multimodales dépendant du langage.
Sources des scores : mteb.