intfloat/multilingual-e5-base

Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/multilingual-e5-base est un modèle d’embedding dense de 278 millions de paramètres. Initialisé à partir de XLM-RoBERTa-base, il comporte 12 couches et couvre 100 langues. Il transforme les textes en vecteurs de 768…

Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/multilingual-e5-base est un modèle d’embedding dense de 278 millions de paramètres. Initialisé à partir de XLM-RoBERTa-base, il comporte 12 couches et couvre 100 langues. Il transforme les textes en vecteurs de 768 dimensions, sans générer de contenu.

Les séquences sont limitées à 512 tokens, puis représentées par pooling moyen et normalisation L2. Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Les préfixes « query: » et « passage: » structurent notamment la recherche asymétrique.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIntfloat
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie8 février 2024
Dimension du vecteur768
Représentationdense
Paramètres278 millions
Paramètres actifs278 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR48,9 %111ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL42,4 %8ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval40,5 %68ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal39,0 %82ᵉ / 208mteb✅ Mesuré
MTEB: Medical54,3 %37ᵉ / 158mteb✅ Mesuré
MTEB: Legal48,5 %46ᵉ / 157mteb✅ Mesuré
MTEB: European57,2 %32ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French39,6 %75ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German47,9 %61ᵉ / 209mteb✅ Mesuré
MTEB: Chemical68,5 %31ᵉ / 41mteb✅ Mesuré
MTEB: Korean67,7 %14ᵉ / 102mteb✅ Mesuré
MTEB: Indic64,6 %17ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent le modèle dans le premier cinquième des classements Korean et Indic, ce qui souligne son intérêt pour des systèmes multilingues associant classification, recherche, reranking, similarité et bitext mining. La couverture de 100 langues facilite la constitution d’un index commun à plusieurs marchés linguistiques. Les vecteurs normalisés sont directement adaptés aux comparaisons de similarité. La licence MIT autorise l’auto-hébergement et l’intégration dans des produits commerciaux, tandis que le format dense de 768 dimensions reste courant pour les bases vectorielles.

Limites et points d’attention. Les performances sont moins bien classées en Japanese, où le modèle se situe presque en queue de classement, ainsi qu’en Chemical et en Spanish. Le résultat Farsi occupe une position intermédiaire. La qualité peut aussi se dégrader dans les langues à faibles ressources. La troncature à 512 tokens impose de découper les documents longs, avec un risque de perdre des relations entre passages. Chaque entrée mobilise 768 valeurs, ce qui alourdit l’index et la recherche face à des embeddings moins dimensionnés. Âgé d’environ deux ans, un intervalle très long dans l’IA, ce modèle de sa période est probablement dépassé par des solutions plus récentes et peut avoir été retiré des catalogues actuels. Usages pertinents : recherche et RAG multilingues, similarité interlingue et clustering, surtout en Korean et dans les langues Indic.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).