Image-Text, Lite

MTEB: Image-Text, Lite est un benchmark multilingue consacré à la qualité des embeddings d’images et de paires image-texte. Créé par MTEB / embeddings-benchmark avec l’équipe MIEB de Chenghao Xiao, Isaac Chung et leurs coauteurs, il reprend les types de tâches de MIEB(Multilingual) dans…

MTEB: Image-Text, Lite est un benchmark multilingue consacré à la qualité des embeddings d’images et de paires image-texte. Créé par MTEB / embeddings-benchmark avec l’équipe MIEB de Chenghao Xiao, Isaac Chung et leurs coauteurs, il reprend les types de tâches de MIEB(Multilingual) dans un format allégé.

Le benchmark évalue les représentations produites pour la recherche, la classification, le clustering et la similarité sémantique. Son objectif est de comparer les modèles à coût réduit tout en préservant leur classement relatif, ce qui facilite une évaluation plus accessible des performances multilingues.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / embeddings-benchmark (équipe MIEB : Chenghao Xiao, Isaac Chung et al.)
Capacités mesuréesQualité des embeddings image multilingues, version allégée préservant le classement relatif des modèles à coût réduit
Modalitéimage,text
Type de questionsÉvaluation d'embeddings image/image-texte (version allégée multilingue)
Métrique d'évaluationMétriques d'embedding selon la tâche (retrieval, classification, clustering, STS)
AccèsPublic
LicenceApache-2.0 (code MTEB)
LanguesMultilingue (sous-ensemble allégé de MIEB Multilingual)
Taille du jeu51 tâches (~18% des GPU-heures de MIEB complet)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (49)

#ModèleÉditeurLicenceScoreSortieFiabilité
1LCO-Embedding/LCO-Embedding-Omni-7BLCO-Embedding🟢 Ouvert68,8 %15 octobre 2025✅ Mesuré
2LCO-Embedding/LCO-Embedding-Omni-3BLCO-Embedding🟢 Ouvert66,4 %23 octobre 2025✅ Mesuré
3Haon-Chen/e5-omni-7BHaon-Chen🟢 Ouvert65,2 %6 janvier 2026✅ Mesuré
4jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert61,1 %1 avril 2026✅ Mesuré
5voyageai/voyage-multimodal-3Voyage AI🟢 Ouvert59,7 %10 novembre 2024✅ Mesuré
6Tevatron/OmniEmbed-v0.1Tevatron🟢 Ouvert58,3 %12 avril 2025✅ Mesuré
7Haon-Chen/e5-omni-3BHaon-Chen🟢 Ouvert57,1 %6 janvier 2026✅ Mesuré
8BidirLM/BidirLM-Omni-2.5B-EmbeddingBidirLM🟢 Ouvert56,0 %7 avril 2026✅ Mesuré
9encord-team/ebind-fullencord-team🟢 Ouvert55,2 %19 novembre 2025✅ Mesuré
10google/siglip-so400m-patch14-384Google🟢 Ouvert53,5 %8 janvier 2024✅ Mesuré
11google/siglip-large-patch16-384Google🟢 Ouvert53,3 %8 janvier 2024✅ Mesuré
12royokong/e5-vroyokong🟢 Ouvert51,9 %17 juillet 2024✅ Mesuré
13google/siglip-large-patch16-256Google🟢 Ouvert51,4 %8 janvier 2024✅ Mesuré
14laion/CLIP-ViT-bigG-14-laion2B-39B-b160klaion🟢 Ouvert51,3 %23 janvier 2023✅ Mesuré
15google/siglip-base-patch16-512Google🟢 Ouvert50,9 %8 janvier 2024✅ Mesuré
16QuanSun/EVA02-CLIP-bigE-14-plusQuanSun🟢 Ouvert50,8 %26 avril 2023✅ Mesuré
17google/siglip-base-patch16-384Google🟢 Ouvert50,5 %8 janvier 2024✅ Mesuré
18laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90Klaion🟢 Ouvert50,4 %26 avril 2023✅ Mesuré
19laion/CLIP-ViT-H-14-laion2B-s32B-b79Klaion🟢 Ouvert50,0 %15 septembre 2022✅ Mesuré
20QuanSun/EVA02-CLIP-bigE-14QuanSun🟢 Ouvert49,9 %26 avril 2023✅ Mesuré
21google/siglip-base-patch16-256-multilingualGoogle🟢 Ouvert49,7 %8 janvier 2024✅ Mesuré
22laion/CLIP-ViT-g-14-laion2B-s34B-b88Klaion🟢 Ouvert49,4 %6 mars 2023✅ Mesuré
23jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert49,4 %1 avril 2026✅ Mesuré
24google/siglip-base-patch16-256Google🟢 Ouvert48,4 %8 janvier 2024✅ Mesuré
25laion/CLIP-ViT-L-14-laion2B-s32B-b82Klaion🟢 Ouvert47,6 %15 septembre 2022✅ Mesuré
26openai/clip-vit-large-patch14OpenAI🟢 Ouvert47,4 %26 février 2021✅ Mesuré
27google/siglip-base-patch16-224Google🟢 Ouvert47,4 %8 janvier 2024✅ Mesuré
28laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90Klaion🟢 Ouvert46,6 %26 avril 2023✅ Mesuré
29TIGER-Lab/VLM2Vec-LoRATIGER-Lab🟢 Ouvert46,0 %8 octobre 2024✅ Mesuré
30TIGER-Lab/VLM2Vec-FullTIGER-Lab🟢 Ouvert45,9 %8 octobre 2024✅ Mesuré
31QuanSun/EVA02-CLIP-L-14QuanSun🟢 Ouvert45,3 %26 avril 2023✅ Mesuré
32openai/clip-vit-base-patch16OpenAI🟢 Ouvert43,5 %26 février 2021✅ Mesuré
33laion/CLIP-ViT-B-32-laion2B-s34B-b79Klaion🟢 Ouvert42,6 %15 septembre 2022✅ Mesuré
34Salesforce/blip-itm-large-cocoSalesforce🟢 Ouvert42,0 %1 août 2023✅ Mesuré
35jinaai/jina-clip-v1Jina AI🟢 Ouvert41,6 %30 mai 2024✅ Mesuré
36laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90Klaion🟢 Ouvert41,5 %26 avril 2023✅ Mesuré
37kakaobrain/align-basekakaobrain🟢 Ouvert41,3 %24 février 2023✅ Mesuré
38Salesforce/blip-itm-base-cocoSalesforce🟢 Ouvert41,0 %1 août 2023✅ Mesuré
39Salesforce/blip-itm-large-flickrSalesforce🟢 Ouvert40,5 %1 août 2023✅ Mesuré
40Salesforce/blip-itm-base-flickrSalesforce🟢 Ouvert39,9 %1 août 2023✅ Mesuré
41BAAI/bge-visualized-m3BAAI🟢 Ouvert39,7 %6 juin 2024✅ Mesuré
42QuanSun/EVA02-CLIP-B-16QuanSun🟢 Ouvert39,5 %26 avril 2023✅ Mesuré
43openai/clip-vit-base-patch32OpenAI🟢 Ouvert38,6 %26 février 2021✅ Mesuré
44BAAI/bge-visualized-baseBAAI🟢 Ouvert38,0 %6 juin 2024✅ Mesuré
45nomic-ai/nomic-embed-vision-v1.5Nomic AI🟢 Ouvert36,4 %8 juin 2024✅ Mesuré
46Salesforce/blip2-opt-2.7bSalesforce🟢 Ouvert34,6 %22 mars 2024✅ Mesuré
47Salesforce/blip2-opt-6.7b-cocoSalesforce🟢 Ouvert33,4 %31 mars 2024✅ Mesuré
48Salesforce/blip-image-captioning-largeSalesforce🟢 Ouvert31,1 %7 décembre 2023✅ Mesuré
49Salesforce/blip-image-captioning-baseSalesforce🟢 Ouvert27,6 %1 août 2023✅ Mesuré

Classement établi sur 49 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 47,6 %.

Notre analyse

Un score élevé indique qu’un modèle produit des embeddings efficaces sur l’ensemble des tâches couvertes, selon les métriques propres à la recherche, à la classification, au clustering et à la similarité sémantique. Le meilleur résultat recensé, 69 % pour LCO-Embedding/LCO-Embedding-Omni-7B, contre une médiane de 48 %, révèle un avantage net sur le modèle médian et ne suggère pas une saturation complète du classement.

La lecture reste toutefois prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique. L’accès public appelle aussi à considérer un risque de contamination lors de l’entraînement ou de l’optimisation des modèles, sans l’assimiler à un fait établi pour les résultats recensés. La portée est volontairement limitée à un sous-ensemble multilingue allégé de MIEB, composé de 51 tâches et consommant environ 18 % des GPU-heures de la version complète. Le classement renseigne donc surtout sur la qualité relative des embeddings dans ce cadre précis, avec un compromis explicite entre coût d’évaluation et fidélité du classement.


Sources des scores : mteb.