Image-Text, English

MTEB: Image-Text, English est un benchmark consacré à la qualité des embeddings d’images et d’ensembles image-texte en anglais. Il a été créé par MTEB / embeddings-benchmark, dans le cadre des travaux de l’équipe MIEB menée par Chenghao Xiao, Isaac Chung et leurs collaborateurs.

MTEB: Image-Text, English est un benchmark consacré à la qualité des embeddings d’images et d’ensembles image-texte en anglais. Il a été créé par MTEB / embeddings-benchmark, dans le cadre des travaux de l’équipe MIEB menée par Chenghao Xiao, Isaac Chung et leurs collaborateurs.

Son évaluation couvre plusieurs usages complémentaires, notamment la classification zero-shot et par linear probing, le clustering, le retrieval, la compositionnalité, la compréhension de documents, le STS visuel et des tâches centrées sur la vision. Cette diversité permet de comparer la polyvalence des modèles d’embeddings au-delà d’un scénario unique.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / embeddings-benchmark (équipe MIEB : Chenghao Xiao, Isaac Chung et al.)
Capacités mesuréesQualité des embeddings d'images en anglais : classification (zero-shot et linear probing), clustering, retrieval, évaluation de compositionnalité, compréhension de documents, STS visuel et tâches centrées vision (CV)
Modalitéimage,text
Type de questionsÉvaluation d'embeddings image/image-texte en anglais
Métrique d'évaluationMétriques d'embedding selon la tâche (classification zero-shot, linear probing, clustering, retrieval, STS visuel)
AccèsPublic
LicenceApache-2.0 (code MTEB)
LanguesAnglais
Taille du jeuSous-ensemble anglais des 130 tâches MIEB
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (40)

#ModèleÉditeurLicenceScoreSortieFiabilité
1jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert65,3 %1 avril 2026✅ Mesuré
2voyageai/voyage-multimodal-3Voyage AI🟢 Ouvert63,6 %10 novembre 2024✅ Mesuré
3google/siglip-so400m-patch14-384Google🟢 Ouvert61,2 %8 janvier 2024✅ Mesuré
4laion/CLIP-ViT-bigG-14-laion2B-39B-b160klaion🟢 Ouvert60,0 %23 janvier 2023✅ Mesuré
5google/siglip-large-patch16-384Google🟢 Ouvert59,9 %8 janvier 2024✅ Mesuré
6QuanSun/EVA02-CLIP-bigE-14-plusQuanSun🟢 Ouvert59,8 %26 avril 2023✅ Mesuré
7laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90Klaion🟢 Ouvert59,4 %26 avril 2023✅ Mesuré
8royokong/e5-vroyokong🟢 Ouvert58,6 %17 juillet 2024✅ Mesuré
9QuanSun/EVA02-CLIP-bigE-14QuanSun🟢 Ouvert58,6 %26 avril 2023✅ Mesuré
10google/siglip-base-patch16-512Google🟢 Ouvert58,5 %8 janvier 2024✅ Mesuré
11laion/CLIP-ViT-H-14-laion2B-s32B-b79Klaion🟢 Ouvert58,4 %15 septembre 2022✅ Mesuré
12laion/CLIP-ViT-g-14-laion2B-s34B-b88Klaion🟢 Ouvert58,3 %6 mars 2023✅ Mesuré
13google/siglip-large-patch16-256Google🟢 Ouvert57,9 %8 janvier 2024✅ Mesuré
14google/siglip-base-patch16-384Google🟢 Ouvert57,8 %8 janvier 2024✅ Mesuré
15laion/CLIP-ViT-L-14-laion2B-s32B-b82Klaion🟢 Ouvert57,2 %15 septembre 2022✅ Mesuré
16jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert55,8 %1 avril 2026✅ Mesuré
17laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90Klaion🟢 Ouvert55,8 %26 avril 2023✅ Mesuré
18google/siglip-base-patch16-256Google🟢 Ouvert55,5 %8 janvier 2024✅ Mesuré
19openai/clip-vit-large-patch14OpenAI🟢 Ouvert55,4 %26 février 2021✅ Mesuré
20google/siglip-base-patch16-224Google🟢 Ouvert54,3 %8 janvier 2024✅ Mesuré
21google/siglip-base-patch16-256-multilingualGoogle🟢 Ouvert53,9 %8 janvier 2024✅ Mesuré
22TIGER-Lab/VLM2Vec-LoRATIGER-Lab🟢 Ouvert53,4 %8 octobre 2024✅ Mesuré
23QuanSun/EVA02-CLIP-L-14QuanSun🟢 Ouvert53,4 %26 avril 2023✅ Mesuré
24TIGER-Lab/VLM2Vec-FullTIGER-Lab🟢 Ouvert53,3 %8 octobre 2024✅ Mesuré
25openai/clip-vit-base-patch16OpenAI🟢 Ouvert51,8 %26 février 2021✅ Mesuré
26Salesforce/blip-itm-large-cocoSalesforce🟢 Ouvert50,9 %1 août 2023✅ Mesuré
27laion/CLIP-ViT-B-32-laion2B-s34B-b79Klaion🟢 Ouvert50,7 %15 septembre 2022✅ Mesuré
28laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90Klaion🟢 Ouvert49,9 %26 avril 2023✅ Mesuré
29jinaai/jina-clip-v1Jina AI🟢 Ouvert49,5 %30 mai 2024✅ Mesuré
30Salesforce/blip-itm-large-flickrSalesforce🟢 Ouvert49,5 %1 août 2023✅ Mesuré
31kakaobrain/align-basekakaobrain🟢 Ouvert49,1 %24 février 2023✅ Mesuré
32Salesforce/blip-itm-base-cocoSalesforce🟢 Ouvert48,9 %1 août 2023✅ Mesuré
33BAAI/bge-visualized-baseBAAI🟢 Ouvert47,4 %6 juin 2024✅ Mesuré
34Salesforce/blip-itm-base-flickrSalesforce🟢 Ouvert47,3 %1 août 2023✅ Mesuré
35openai/clip-vit-base-patch32OpenAI🟢 Ouvert47,0 %26 février 2021✅ Mesuré
36QuanSun/EVA02-CLIP-B-16QuanSun🟢 Ouvert46,5 %26 avril 2023✅ Mesuré
37BAAI/bge-visualized-m3BAAI🟢 Ouvert46,0 %6 juin 2024✅ Mesuré
38nomic-ai/nomic-embed-vision-v1.5Nomic AI🟢 Ouvert45,5 %8 juin 2024✅ Mesuré
39Salesforce/blip2-opt-2.7bSalesforce🟢 Ouvert45,2 %22 mars 2024✅ Mesuré
40Salesforce/blip2-opt-6.7b-cocoSalesforce🟢 Ouvert45,1 %31 mars 2024✅ Mesuré

Classement établi sur 40 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 54,1 %.

Notre analyse

Un score élevé indique qu’un modèle produit des représentations efficaces sur un ensemble varié de tâches visuelles et multimodales en anglais. Il reflète donc une qualité globale, combinant notamment classification, regroupement, recherche et mesure de similarité, plutôt qu’une aptitude isolée.

La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Leur niveau de contrôle n’est donc pas équivalent à celui de résultats systématiquement mesurés de manière indépendante. La contamination constitue également un point de vigilance pour un benchmark public, tandis que sa portée reste circonscrite aux embeddings d’images et image-texte en anglais.

Parmi les 40 modèles évalués dans la base, jinaai/jina-embeddings-v5-omni-small arrive en tête avec 65 %, contre une médiane de 54 %. Cet écart de 11 points met en évidence une avance mesurable du meilleur modèle sur le centre de la distribution. Le score maximal observé reste éloigné d’un plafond parfait, ce qui ne suggère pas une saturation complète du benchmark. Le classement renseigne surtout sur la polyvalence relative des modèles dans le périmètre précis de MTEB: Image-Text, English.


Sources des scores : mteb.