QuanSun/EVA02-CLIP-B-16
Publié par QuanSun le 26 avril 2023, EVA02-CLIP-B-16 est un modèle d’embedding dense de 149 millions de paramètres actifs. Il produit des vecteurs de 512 dimensions et couvre les représentations d’images ainsi que les associations entre images et textes, en anglais et dans un cadre…
Publié par QuanSun le 26 avril 2023, EVA02-CLIP-B-16 est un modèle d’embedding dense de 149 millions de paramètres actifs. Il produit des vecteurs de 512 dimensions et couvre les représentations d’images ainsi que les associations entre images et textes, en anglais et dans un cadre multilingue évalué sur 39 langues.
Ses vecteurs servent à la recherche sémantique, à la similarité, au clustering et à la sélection de contenus pour un système RAG, sans générer de texte. Sa licence MIT, ouverte et permissive, autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | QuanSun |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 26 avril 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 48,1 % | 38ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 46,5 % | 36ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 41,5 % | 36ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 39,5 % | 42ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Son meilleur résultat MTEB concerne le track Image only, qui regroupe des tâches de retrieval, de classification et de clustering. Le modèle prend également en charge la correspondance image-texte en anglais et en contexte multilingue, ce qui permet de construire des moteurs de recherche multimodaux. La sortie dense de 512 dimensions limite la taille des index et le coût de comparaison par rapport à des représentations de dimension plus élevée. La licence MIT facilite le déploiement et l’adaptation dans une infrastructure maîtrisée.
Limites et points d’attention. Malgré un score brut supérieur sur Image only, le modèle se situe dans le bas des classements sur tous les tracks MTEB fournis. Les résultats Image-Text en anglais et en multilingue restent faibles relativement aux autres modèles évalués, tandis que le track Image-Text, Lite constitue son positionnement le moins favorable. Sorti en 2023, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents de même catégorie. Usages pertinents : indexation multimodale compacte, recherche image-texte, similarité visuelle, clustering et retrieval pour un RAG lorsque la licence MIT et l’auto-hébergement priment sur les performances de tête de classement.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).