royokong/e5-v
Publié par royokong le 17 juillet 2024, e5-v est un modèle d’embedding multimodal de 8 milliards de paramètres, tous actifs. Affiné à partir de lmms-lab/llama3-llava-next-8b, il encode le texte et les images sous forme de vecteurs denses uniques de 4 096 dimensions.
Publié par royokong le 17 juillet 2024, e5-v est un modèle d’embedding multimodal de 8 milliards de paramètres, tous actifs. Affiné à partir de lmms-lab/llama3-llava-next-8b, il encode le texte et les images sous forme de vecteurs denses uniques de 4 096 dimensions.
Le modèle sert à mesurer la similarité entre textes et images, notamment pour la recherche sémantique multilingue, le RAG multimodal et le clustering. Compatible avec Sentence Transformers et transformers, il emploie un template de chat personnalisé comportant des instructions distinctes selon le type d’entrée. Son ancienneté d’environ deux ans est très importante à l’échelle de l’IA et le situe derrière plusieurs générations plus récentes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | royokong |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 17 juillet 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | vecteurs denses uniques pour texte et image |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 60,4 % | 14ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 58,6 % | 8ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 58,2 % | 3ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: ViDoRe (V1&V2) | 58,1 % | 43ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 51,9 % | 12ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. E5-V se distingue surtout sur les tâches MTEB associant images et textes. Il figure parmi les meilleurs modèles évalués sur le track multilingue couvrant 39 langues, et dans le top 10 sur le track anglais. Ce positionnement indique un intérêt marqué pour la classification d’images et la mise en correspondance sémantique entre requêtes textuelles et contenus visuels. Ses résultats en Image only et Image-Text, Lite restent également bien placés par rapport aux modèles évalués. L’encodage conjoint du texte et de l’image facilite la création d’un même espace vectoriel pour la recherche multimodale.
Limites et points d'attention. Les résultats sont nettement moins favorables sur ViDoRe, où e5-v se situe près du bas du classement pour la recherche dans des documents visuels variés. La dimension de 4 096 alourdit les index et augmente le coût de stockage ainsi que celui des calculs de similarité. Les 8 milliards de paramètres étant tous actifs, chaque encodage mobilise l’ensemble du modèle. Son âge impose aussi de comparer ses performances à celles d’embeddings multimodaux plus récents. Usages pertinents : recherche texte-image multilingue, RAG multimodal, classement par similarité et clustering de contenus textuels ou visuels.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).