Image only

MTEB: Image only est un benchmark consacré à la qualité des embeddings purement visuels. Publié en 2025 par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et leurs coauteurs, il repose sur un sous-ensemble de tâches MIEB ne nécessitant aucun encodeur de texte.

MTEB: Image only est un benchmark consacré à la qualité des embeddings purement visuels. Publié en 2025 par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et leurs coauteurs, il repose sur un sous-ensemble de tâches MIEB ne nécessitant aucun encodeur de texte.

Il évalue la représentation des images à travers la recherche, la classification, le clustering et la similarité sémantique visuelle. Son rôle est de comparer la capacité des modèles à produire des embeddings utiles dans plusieurs types de traitements fondés uniquement sur l’image.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / embeddings-benchmark (équipe MIEB : Chenghao Xiao, Isaac Chung et al.)
Capacités mesuréesQualité des embeddings purement visuels : retrieval, classification, clustering et STS visuel
ModalitéImage
Type de questionsÉvaluation d'embeddings d'images (tâches n'exigeant pas d'encodeur de texte)
Métrique d'évaluationMétriques d'embedding selon la tâche (retrieval, classification, clustering, STS visuel)
AccèsPublic
LicenceApache-2.0 (code MTEB)
LanguesSans objet (tâches purement image)
Taille du jeuSous-ensemble des tâches MIEB excluant celles requérant un encodeur de texte
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (45)

#ModèleÉditeurLicenceScoreSortieFiabilité
1jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert69,1 %1 avril 2026✅ Mesuré
2voyageai/voyage-multimodal-3Voyage AI🟢 Ouvert67,3 %10 novembre 2024✅ Mesuré
3QuanSun/EVA02-CLIP-bigE-14-plusQuanSun🟢 Ouvert65,2 %26 avril 2023✅ Mesuré
4google/siglip-so400m-patch14-384Google🟢 Ouvert64,2 %8 janvier 2024✅ Mesuré
5laion/CLIP-ViT-bigG-14-laion2B-39B-b160klaion🟢 Ouvert64,0 %23 janvier 2023✅ Mesuré
6laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90Klaion🟢 Ouvert63,6 %26 avril 2023✅ Mesuré
7google/siglip-large-patch16-384Google🟢 Ouvert63,5 %8 janvier 2024✅ Mesuré
8QuanSun/EVA02-CLIP-bigE-14QuanSun🟢 Ouvert63,5 %26 avril 2023✅ Mesuré
9google/siglip-large-patch16-256Google🟢 Ouvert62,6 %8 janvier 2024✅ Mesuré
10laion/CLIP-ViT-H-14-laion2B-s32B-b79Klaion🟢 Ouvert61,9 %15 septembre 2022✅ Mesuré
11laion/CLIP-ViT-g-14-laion2B-s34B-b88Klaion🟢 Ouvert61,9 %6 mars 2023✅ Mesuré
12google/siglip-base-patch16-512Google🟢 Ouvert60,9 %8 janvier 2024✅ Mesuré
13google/siglip-base-patch16-384Google🟢 Ouvert60,8 %8 janvier 2024✅ Mesuré
14royokong/e5-vroyokong🟢 Ouvert60,4 %17 juillet 2024✅ Mesuré
15laion/CLIP-ViT-L-14-laion2B-s32B-b82Klaion🟢 Ouvert59,9 %15 septembre 2022✅ Mesuré
16google/siglip-base-patch16-256-multilingualGoogle🟢 Ouvert59,9 %8 janvier 2024✅ Mesuré
17jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert59,7 %1 avril 2026✅ Mesuré
18laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90Klaion🟢 Ouvert59,7 %26 avril 2023✅ Mesuré
19google/siglip-base-patch16-256Google🟢 Ouvert59,5 %8 janvier 2024✅ Mesuré
20openai/clip-vit-large-patch14OpenAI🟢 Ouvert59,2 %26 février 2021✅ Mesuré
21google/siglip-base-patch16-224Google🟢 Ouvert58,6 %8 janvier 2024✅ Mesuré
22QuanSun/EVA02-CLIP-L-14QuanSun🟢 Ouvert56,8 %26 avril 2023✅ Mesuré
23Salesforce/blip-itm-large-cocoSalesforce🟢 Ouvert56,3 %1 août 2023✅ Mesuré
24TIGER-Lab/VLM2Vec-LoRATIGER-Lab🟢 Ouvert56,1 %8 octobre 2024✅ Mesuré
25TIGER-Lab/VLM2Vec-FullTIGER-Lab🟢 Ouvert55,7 %8 octobre 2024✅ Mesuré
26Salesforce/blip-itm-base-cocoSalesforce🟢 Ouvert55,7 %1 août 2023✅ Mesuré
27laion/CLIP-ViT-B-32-laion2B-s34B-b79Klaion🟢 Ouvert55,2 %15 septembre 2022✅ Mesuré
28openai/clip-vit-base-patch16OpenAI🟢 Ouvert55,1 %26 février 2021✅ Mesuré
29Salesforce/blip-itm-large-flickrSalesforce🟢 Ouvert54,5 %1 août 2023✅ Mesuré
30jinaai/jina-clip-v1Jina AI🟢 Ouvert54,1 %30 mai 2024✅ Mesuré
31laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90Klaion🟢 Ouvert53,9 %26 avril 2023✅ Mesuré
32Salesforce/blip-itm-base-flickrSalesforce🟢 Ouvert53,6 %1 août 2023✅ Mesuré
33BAAI/bge-visualized-baseBAAI🟢 Ouvert53,1 %6 juin 2024✅ Mesuré
34BAAI/bge-visualized-m3BAAI🟢 Ouvert52,4 %6 juin 2024✅ Mesuré
35kakaobrain/align-basekakaobrain🟢 Ouvert50,9 %24 février 2023✅ Mesuré
36openai/clip-vit-base-patch32OpenAI🟢 Ouvert49,0 %26 février 2021✅ Mesuré
37Salesforce/blip2-opt-2.7bSalesforce🟢 Ouvert48,5 %22 mars 2024✅ Mesuré
38QuanSun/EVA02-CLIP-B-16QuanSun🟢 Ouvert48,1 %26 avril 2023✅ Mesuré
39Salesforce/blip2-opt-6.7b-cocoSalesforce🟢 Ouvert47,6 %31 mars 2024✅ Mesuré
40facebook/dinov2-giantMeta🟢 Ouvert46,3 %18 juillet 2023✅ Mesuré
41facebook/dinov2-largeMeta🟢 Ouvert46,2 %18 juillet 2023✅ Mesuré
42facebook/dinov2-baseMeta🟢 Ouvert45,9 %18 juillet 2023✅ Mesuré
43nomic-ai/nomic-embed-vision-v1.5Nomic AI🟢 Ouvert45,4 %8 juin 2024✅ Mesuré
44facebook/dinov2-smallMeta🟢 Ouvert43,1 %18 juillet 2023✅ Mesuré
45nyu-visionx/moco-v3-vit-bnyu-visionx🟢 Ouvert37,5 %3 juin 2024✅ Mesuré

Classement établi sur 45 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 56,3 %.

Notre analyse

Un score élevé indique qu’un modèle produit des représentations visuelles efficaces sur plusieurs familles de tâches, selon les métriques propres à la recherche, à la classification, au clustering et au STS visuel. Il ne correspond donc pas à une capacité unique, mais à une qualité agrégée d’embeddings d’images. La fiabilité du classement doit toutefois être nuancée, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que tous mesurés dans un cadre indépendant uniforme.

Avec 45 modèles évalués, une médiane de 56 % et un meilleur résultat de 69 % pour jinaai/jina-embeddings-v5-omni-small de Jina AI, le classement fait apparaître un écart notable entre le niveau central et la tête. Ces valeurs ne suggèrent pas une saturation complète du benchmark. Sa portée reste volontairement ciblée sur les tâches purement visuelles du sous-ensemble MIEB. Il mesure ainsi la qualité des embeddings d’images, mais exclut explicitement les tâches nécessitant un encodeur de texte. Le classement doit être interprété dans ce périmètre précis, sans l’étendre aux capacités multimodales dépendant du langage.


Sources des scores : mteb.