intfloat/e5-large
Publié par Intfloat le 26 décembre 2022, intfloat/e5-large est un modèle d’embedding anglophone sous licence ouverte Apache 2.0. Ses 24 couches et 335 millions de paramètres actifs produisent des vecteurs denses de 1 024 dimensions par pooling moyen. Les textes sont limités à 512 tokens.
Publié par Intfloat le 26 décembre 2022, intfloat/e5-large est un modèle d’embedding anglophone sous licence ouverte Apache 2.0. Ses 24 couches et 335 millions de paramètres actifs produisent des vecteurs denses de 1 024 dimensions par pooling moyen. Les textes sont limités à 512 tokens.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération documentaire pour le RAG, à la détection de paraphrases, à la classification linéaire et au clustering. La recherche asymétrique distingue requêtes et documents grâce aux préfixes « query: » et « passage: ».
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 26 décembre 2022 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,0 % | 102ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 39,4 % | 77ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 33,7 % | 108ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 42,9 % | 54ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 41,2 % | 70ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,7 % | 52ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 31,8 % | 87ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 27,1 % | 101ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 71,5 % | 14ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 51,7 % | 49ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 43,3 % | 36ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 42,8 % | 56ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le positionnement MTEB est le plus favorable sur les textes du domaine Chemical, avec des tâches couvrant notamment la classification, le clustering et l’alignement de textes. Le track Medical fait également partie de ses évaluations relativement solides, ce qui indique une utilité possible pour la recherche d’informations biomédicales, cliniques ou de santé grand public en anglais. Les préfixes dédiés facilitent la séparation entre requêtes courtes et passages documentaires. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d’attention. Les résultats sur BEIR placent le modèle dans la seconde moitié du classement, ce qui traduit une efficacité plus modeste en recherche zero-shot sur des tâches et domaines hétérogènes. Les tracks French, European et German restent difficilement exploitables en pratique puisque le modèle fonctionne uniquement avec des textes anglais. La limite de 512 tokens impose de découper les documents longs. Les vecteurs de 1 024 dimensions alourdissent aussi les index et le calcul de similarité. Sorti il y a environ quatre ans, il appartient à une génération ancienne, probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, similarité, classification et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).