QuanSun/EVA02-CLIP-bigE-14
Publié par QuanSun le 26 avril 2023, EVA02-CLIP-bigE-14 est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Il produit des représentations vectorielles denses de 1 024 dimensions et couvre les contenus visuels ainsi que les associations entre images et textes, en anglais…
Publié par QuanSun le 26 avril 2023, EVA02-CLIP-bigE-14 est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Il produit des représentations vectorielles denses de 1 024 dimensions et couvre les contenus visuels ainsi que les associations entre images et textes, en anglais et dans un cadre multilingue.
Distribué sous licence ouverte MIT, il peut servir à indexer des images et leurs descriptions, effectuer de la recherche sémantique ou de similarité, alimenter la récupération d’un système RAG multimodal et regrouper des contenus par proximité vectorielle. Il ne génère pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | QuanSun |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 26 avril 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 63,5 % | 8ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 58,6 % | 9ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 52,2 % | 16ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 49,9 % | 20ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les évaluations MTEB placent le modèle dans le top 10 pour la qualité des embeddings d’images seules et pour les tâches image-texte en anglais. Ce positionnement indique une aptitude solide à la recherche et au rapprochement de contenus visuels, ainsi qu’à la classification et au clustering évalués dans ces tracks. La couverture multilingue s’étend à 39 langues, ce qui permet d’envisager des index image-texte dépassant le seul anglais. La licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.
Limites et points d'attention. Les résultats sont moins favorables sur le track Image-Text, Multilingual, où le modèle se situe hors du top 10, et davantage encore sur Image-Text, Lite, au milieu du classement. Ses 5 milliards de paramètres rendent aussi son déploiement plus exigeant que celui de modèles d’embedding plus petits. Sorti il y a environ trois ans, il appartient à une génération ancienne à l’échelle de l’IA et peut être dépassé par des solutions plus récentes. Usages pertinents : recherche d’images, similarité visuelle, clustering et RAG multimodal, surtout lorsque les performances image seule ou image-texte en anglais priment.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).