Image-Text, Multilingual

MTEB: Image-Text, Multilingual est un benchmark public consacré à la qualité des embeddings d’images et image-texte dans un contexte multilingue. Publié par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et al., il étend l’évaluation anglophone MIEB à des jeux…

MTEB: Image-Text, Multilingual est un benchmark public consacré à la qualité des embeddings d’images et image-texte dans un contexte multilingue. Publié par MTEB / embeddings-benchmark et l’équipe MIEB de Chenghao Xiao, Isaac Chung et al., il étend l’évaluation anglophone MIEB à des jeux de retrieval multilingues.

Son périmètre couvre notamment la classification, le clustering, le retrieval, la compositionnalité, la compréhension de documents et le STS visuel. Cette diversité permet de comparer la capacité des modèles à produire des représentations utiles pour plusieurs usages de vision et de recherche sémantique.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / embeddings-benchmark (équipe MIEB : Chenghao Xiao, Isaac Chung et al.)
Capacités mesuréesQualité des embeddings d'images multilingues : classification (zero-shot et linear probing), clustering, retrieval, compositionnalité, compréhension de documents, STS visuel et tâches centrées vision
Modalitéimage,text
Type de questionsÉvaluation d'embeddings image/image-texte multilingue
Métrique d'évaluationMétriques d'embedding selon la tâche (classification zero-shot, linear probing, clustering, retrieval, STS visuel)
AccèsPublic
LicenceApache-2.0 (code MTEB)
LanguesMultilingue (~38-39 langues)
Taille du jeu130 tâches, 8 catégories
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (40)

#ModèleÉditeurLicenceScoreSortieFiabilité
1jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert65,1 %1 avril 2026✅ Mesuré
2voyageai/voyage-multimodal-3Voyage AI🟢 Ouvert63,8 %10 novembre 2024✅ Mesuré
3royokong/e5-vroyokong🟢 Ouvert58,2 %17 juillet 2024✅ Mesuré
4google/siglip-so400m-patch14-384Google🟢 Ouvert57,1 %8 janvier 2024✅ Mesuré
5google/siglip-large-patch16-384Google🟢 Ouvert57,0 %8 janvier 2024✅ Mesuré
6google/siglip-large-patch16-256Google🟢 Ouvert55,2 %8 janvier 2024✅ Mesuré
7google/siglip-base-patch16-512Google🟢 Ouvert55,0 %8 janvier 2024✅ Mesuré
8jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert54,5 %1 avril 2026✅ Mesuré
9laion/CLIP-ViT-bigG-14-laion2B-39B-b160klaion🟢 Ouvert54,2 %23 janvier 2023✅ Mesuré
10google/siglip-base-patch16-384Google🟢 Ouvert54,2 %8 janvier 2024✅ Mesuré
11QuanSun/EVA02-CLIP-bigE-14-plusQuanSun🟢 Ouvert53,5 %26 avril 2023✅ Mesuré
12laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90Klaion🟢 Ouvert53,4 %26 avril 2023✅ Mesuré
13google/siglip-base-patch16-256-multilingualGoogle🟢 Ouvert53,1 %8 janvier 2024✅ Mesuré
14laion/CLIP-ViT-H-14-laion2B-s32B-b79Klaion🟢 Ouvert52,7 %15 septembre 2022✅ Mesuré
15laion/CLIP-ViT-g-14-laion2B-s34B-b88Klaion🟢 Ouvert52,4 %6 mars 2023✅ Mesuré
16QuanSun/EVA02-CLIP-bigE-14QuanSun🟢 Ouvert52,2 %26 avril 2023✅ Mesuré
17google/siglip-base-patch16-256Google🟢 Ouvert52,0 %8 janvier 2024✅ Mesuré
18google/siglip-base-patch16-224Google🟢 Ouvert50,9 %8 janvier 2024✅ Mesuré
19laion/CLIP-ViT-L-14-laion2B-s32B-b82Klaion🟢 Ouvert50,6 %15 septembre 2022✅ Mesuré
20TIGER-Lab/VLM2Vec-LoRATIGER-Lab🟢 Ouvert50,5 %8 octobre 2024✅ Mesuré
21TIGER-Lab/VLM2Vec-FullTIGER-Lab🟢 Ouvert50,4 %8 octobre 2024✅ Mesuré
22openai/clip-vit-large-patch14OpenAI🟢 Ouvert49,9 %26 février 2021✅ Mesuré
23laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90Klaion🟢 Ouvert49,6 %26 avril 2023✅ Mesuré
24QuanSun/EVA02-CLIP-L-14QuanSun🟢 Ouvert47,3 %26 avril 2023✅ Mesuré
25openai/clip-vit-base-patch16OpenAI🟢 Ouvert46,2 %26 février 2021✅ Mesuré
26Salesforce/blip-itm-large-cocoSalesforce🟢 Ouvert45,9 %1 août 2023✅ Mesuré
27laion/CLIP-ViT-B-32-laion2B-s34B-b79Klaion🟢 Ouvert45,2 %15 septembre 2022✅ Mesuré
28jinaai/jina-clip-v1Jina AI🟢 Ouvert44,9 %30 mai 2024✅ Mesuré
29Salesforce/blip-itm-base-cocoSalesforce🟢 Ouvert44,7 %1 août 2023✅ Mesuré
30Salesforce/blip-itm-large-flickrSalesforce🟢 Ouvert44,4 %1 août 2023✅ Mesuré
31laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90Klaion🟢 Ouvert44,3 %26 avril 2023✅ Mesuré
32kakaobrain/align-basekakaobrain🟢 Ouvert44,2 %24 février 2023✅ Mesuré
33BAAI/bge-visualized-m3BAAI🟢 Ouvert43,8 %6 juin 2024✅ Mesuré
34Salesforce/blip-itm-base-flickrSalesforce🟢 Ouvert43,0 %1 août 2023✅ Mesuré
35BAAI/bge-visualized-baseBAAI🟢 Ouvert41,7 %6 juin 2024✅ Mesuré
36QuanSun/EVA02-CLIP-B-16QuanSun🟢 Ouvert41,5 %26 avril 2023✅ Mesuré
37openai/clip-vit-base-patch32OpenAI🟢 Ouvert41,4 %26 février 2021✅ Mesuré
38Salesforce/blip2-opt-2.7bSalesforce🟢 Ouvert39,7 %22 mars 2024✅ Mesuré
39Salesforce/blip2-opt-6.7b-cocoSalesforce🟢 Ouvert39,6 %31 mars 2024✅ Mesuré
40nomic-ai/nomic-embed-vision-v1.5Nomic AI🟢 Ouvert39,3 %8 juin 2024✅ Mesuré

Classement établi sur 40 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 50,4 %.

Notre analyse

Un score élevé indique qu’un modèle produit des embeddings performants sur un ensemble varié de tâches image et image-texte, dans de nombreuses langues. Il synthétise toutefois des métriques propres à chaque catégorie, notamment la classification zero-shot, le linear probing, le clustering, le retrieval et le STS visuel. Il doit donc être interprété comme une mesure agrégée de polyvalence plutôt que comme une garantie uniforme sur chaque usage ou chaque langue.

La fiabilité du classement appelle une certaine prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que tous issus d’une mesure indépendante. Dans la base, jinaai/jina-embeddings-v5-omni-small atteint 65 %, contre une médiane de 50 % parmi les 40 modèles évalués. Cet écart montre que le benchmark conserve un pouvoir de différenciation et ne paraît pas entièrement saturé au sommet. Sa portée reste centrée sur la qualité des embeddings visuels multilingues couverte par ses 130 tâches. Le classement compare donc cette aptitude spécifique, sans constituer une mesure générale de toutes les capacités d’un modèle d’IA.


Sources des scores : mteb.