QuanSun/EVA02-CLIP-L-14
Publié par QuanSun le 26 avril 2023, QuanSun/EVA02-CLIP-L-14 est un modèle d’embedding dense de 428 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et se concentre sur la représentation d’images ainsi que sur leur mise en correspondance avec du texte en…
Publié par QuanSun le 26 avril 2023, QuanSun/EVA02-CLIP-L-14 est un modèle d’embedding dense de 428 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et se concentre sur la représentation d’images ainsi que sur leur mise en correspondance avec du texte en anglais ou dans plusieurs langues.
Ces vecteurs servent à la recherche sémantique image-texte, à la similarité, au clustering et à l’indexation pour des systèmes de RAG multimodaux. Distribué sous licence MIT, le modèle peut être auto-hébergé et intégré à des applications commerciales. Son ancienneté d’environ trois ans en fait toutefois une génération très ancienne à l’échelle de l’IA.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | QuanSun |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 26 avril 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 428 millions |
| Paramètres actifs | 428 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 56,8 % | 22ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 53,4 % | 23ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 47,3 % | 24ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 45,3 % | 31ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Le meilleur résultat relatif de QuanSun/EVA02-CLIP-L-14 apparaît sur le track MTEB Image only, où il se situe au milieu du classement pour un ensemble mêlant retrieval, classification et clustering. Les évaluations Image-Text montrent aussi une capacité à rapprocher images et textes en anglais et dans un cadre multilingue couvrant 39 langues. La représentation dense de 768 dimensions offre un compromis pratique pour constituer des index moins lourds que ceux reposant sur des vecteurs plus larges. La licence MIT facilite par ailleurs l’auto-hébergement, la modification et l’exploitation commerciale.
Limites et points d'attention. Aucun des quatre tracks MTEB fournis ne place le modèle parmi les premiers. Les résultats Image-Text English et Multilingual restent dans la seconde moitié de leurs classements, tandis que le track Image-Text Lite constitue son positionnement relatif le plus faible. Les 428 millions de paramètres impliquent également un modèle plus lourd à exécuter que des encodeurs de taille inférieure. Sorti en 2023, il appartient à une génération probablement dépassée par des modèles plus récents et souvent retirée des catalogues actifs. Usages pertinents : recherche image-texte, déduplication visuelle, regroupement d’images et RAG multimodal lorsque l’ouverture de la licence prime sur l’état de l’art.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).