QuanSun/EVA02-CLIP-L-14

Publié par QuanSun le 26 avril 2023, QuanSun/EVA02-CLIP-L-14 est un modèle d’embedding dense de 428 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et se concentre sur la représentation d’images ainsi que sur leur mise en correspondance avec du texte en…

Publié par QuanSun le 26 avril 2023, QuanSun/EVA02-CLIP-L-14 est un modèle d’embedding dense de 428 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et se concentre sur la représentation d’images ainsi que sur leur mise en correspondance avec du texte en anglais ou dans plusieurs langues.

Ces vecteurs servent à la recherche sémantique image-texte, à la similarité, au clustering et à l’indexation pour des systèmes de RAG multimodaux. Distribué sous licence MIT, le modèle peut être auto-hébergé et intégré à des applications commerciales. Son ancienneté d’environ trois ans en fait toutefois une génération très ancienne à l’échelle de l’IA.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurQuanSun
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie26 avril 2023
Dimension du vecteur768
Représentationdense
Paramètres428 millions
Paramètres actifs428 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only56,8 %22ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English53,4 %23ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual47,3 %24ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite45,3 %31ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

▶ QuanSun/EVA02-CLIP-L-1457 %

MTEB: Image-Text, English

TIGER-Lab/VLM2Vec-LoRA53 %
▶ QuanSun/EVA02-CLIP-L-1453 %

Notre analyse

Forces. Le meilleur résultat relatif de QuanSun/EVA02-CLIP-L-14 apparaît sur le track MTEB Image only, où il se situe au milieu du classement pour un ensemble mêlant retrieval, classification et clustering. Les évaluations Image-Text montrent aussi une capacité à rapprocher images et textes en anglais et dans un cadre multilingue couvrant 39 langues. La représentation dense de 768 dimensions offre un compromis pratique pour constituer des index moins lourds que ceux reposant sur des vecteurs plus larges. La licence MIT facilite par ailleurs l’auto-hébergement, la modification et l’exploitation commerciale.

Limites et points d'attention. Aucun des quatre tracks MTEB fournis ne place le modèle parmi les premiers. Les résultats Image-Text English et Multilingual restent dans la seconde moitié de leurs classements, tandis que le track Image-Text Lite constitue son positionnement relatif le plus faible. Les 428 millions de paramètres impliquent également un modèle plus lourd à exécuter que des encodeurs de taille inférieure. Sorti en 2023, il appartient à une génération probablement dépassée par des modèles plus récents et souvent retirée des catalogues actifs. Usages pertinents : recherche image-texte, déduplication visuelle, regroupement d’images et RAG multimodal lorsque l’ouverture de la licence prime sur l’état de l’art.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).