intfloat/multilingual-e5-base
Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/multilingual-e5-base est un modèle d’embedding dense de 278 millions de paramètres. Initialisé à partir de XLM-RoBERTa-base, il comporte 12 couches et couvre 100 langues. Il transforme les textes en vecteurs de 768…
Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/multilingual-e5-base est un modèle d’embedding dense de 278 millions de paramètres. Initialisé à partir de XLM-RoBERTa-base, il comporte 12 couches et couvre 100 langues. Il transforme les textes en vecteurs de 768 dimensions, sans générer de contenu.
Les séquences sont limitées à 512 tokens, puis représentées par pooling moyen et normalisation L2. Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Les préfixes « query: » et « passage: » structurent notamment la recherche asymétrique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 8 février 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 278 millions |
| Paramètres actifs | 278 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 48,9 % | 111ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 42,4 % | 8ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 40,5 % | 68ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 39,0 % | 82ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 54,3 % | 37ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 48,5 % | 46ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 57,2 % | 32ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 39,6 % | 75ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 47,9 % | 61ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 68,5 % | 31ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: Korean | 67,7 % | 14ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Indic | 64,6 % | 17ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Les résultats MTEB placent le modèle dans le premier cinquième des classements Korean et Indic, ce qui souligne son intérêt pour des systèmes multilingues associant classification, recherche, reranking, similarité et bitext mining. La couverture de 100 langues facilite la constitution d’un index commun à plusieurs marchés linguistiques. Les vecteurs normalisés sont directement adaptés aux comparaisons de similarité. La licence MIT autorise l’auto-hébergement et l’intégration dans des produits commerciaux, tandis que le format dense de 768 dimensions reste courant pour les bases vectorielles.
Limites et points d’attention. Les performances sont moins bien classées en Japanese, où le modèle se situe presque en queue de classement, ainsi qu’en Chemical et en Spanish. Le résultat Farsi occupe une position intermédiaire. La qualité peut aussi se dégrader dans les langues à faibles ressources. La troncature à 512 tokens impose de découper les documents longs, avec un risque de perdre des relations entre passages. Chaque entrée mobilise 768 valeurs, ce qui alourdit l’index et la recherche face à des embeddings moins dimensionnés. Âgé d’environ deux ans, un intervalle très long dans l’IA, ce modèle de sa période est probablement dépassé par des solutions plus récentes et peut avoir été retiré des catalogues actuels. Usages pertinents : recherche et RAG multilingues, similarité interlingue et clustering, surtout en Korean et dans les langues Indic.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).