QuanSun/EVA02-CLIP-bigE-14-plus
Publié par QuanSun le 26 avril 2023, QuanSun/EVA02-CLIP-bigE-14-plus est un modèle d’embedding dense de 5 milliards de paramètres actifs. Il produit des vecteurs de 1 024 dimensions et associe images et textes, avec une évaluation couvrant notamment l’anglais et 39 langues.
Publié par QuanSun le 26 avril 2023, QuanSun/EVA02-CLIP-bigE-14-plus est un modèle d’embedding dense de 5 milliards de paramètres actifs. Il produit des vecteurs de 1 024 dimensions et associe images et textes, avec une évaluation couvrant notamment l’anglais et 39 langues.
Ses représentations servent à la recherche sémantique et multimodale, à la similarité, au clustering ainsi qu’à l’étape de recherche d’un système RAG. Sa licence MIT, ouverte et permissive, autorise l’intégration et l’auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | QuanSun |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 26 avril 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 65,2 % | 3ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 59,8 % | 6ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 53,5 % | 11ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 50,8 % | 16ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Le modèle se distingue surtout sur MTEB Image only, où il figure parmi les meilleurs modèles évalués pour des tâches combinant retrieval, classification et clustering. Il reste également dans le groupe de tête sur MTEB Image-Text, English, ce qui le rend pertinent pour rapprocher des images et des descriptions anglaises. Son évaluation multilingue couvre 39 langues et confirme une capacité à traiter des corpus visuels accompagnés de textes dans plusieurs langues. La licence MIT constitue un avantage pratique pour le déploiement autonome et l’adaptation à différents environnements.
Limites et points d’attention. Les résultats sont moins compétitifs sur MTEB Image-Text, Multilingual et davantage encore sur MTEB Image-Text, Lite, où le modèle se situe hors du top 10. Ses 5 milliards de paramètres imposent une infrastructure plus lourde que celle d’embeddings plus petits, tandis que les vecteurs de 1 024 dimensions augmentent la taille des index et le coût de la recherche. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche image-texte, classement de similarité, clustering visuel et RAG multimodal, surtout en anglais.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).