Intfloat: Multilingual-E5-Large

Intfloat: Multilingual-E5-Large est un modèle d’embedding multilingue publié par Intfloat sous licence ouverte MIT. Initialisé depuis XLM-RoBERTa-Large, il compte 560 millions de paramètres répartis sur 24 couches et produit des vecteurs denses de 1 024 dimensions.

Intfloat: Multilingual-E5-Large est un modèle d’embedding multilingue publié par Intfloat sous licence ouverte MIT. Initialisé depuis XLM-RoBERTa-Large, il compte 560 millions de paramètres répartis sur 24 couches et produit des vecteurs denses de 1 024 dimensions.

Le modèle couvre 100 langues et traite jusqu’à 512 tokens, les textes plus longs étant tronqués. Il transforme les requêtes et les passages en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité, à la recherche de paraphrases, au bitext mining, à la classification linéaire et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIntfloat
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur1 024
Représentationdense
Paramètres560 millions
Paramètres actifs560 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,5 %82ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL45,9 %3ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval40,4 %70ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal38,1 %86ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare54,2 %49ᵉ / 97mteb✅ Mesuré
MTEB: Medical56,6 %32ᵉ / 158mteb✅ Mesuré
MTEB: Legal48,4 %47ᵉ / 157mteb✅ Mesuré
MTEB: European58,3 %27ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French47,0 %55ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German43,2 %78ᵉ / 209mteb✅ Mesuré
MTEB: Chemical68,3 %33ᵉ / 41mteb✅ Mesuré
MTEB: Spanish64,7 %16ᵉ / 27mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,01 $

Prix en dollars US par million de tokens.

Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Les résultats MTEB les plus favorables se trouvent sur le track European et dans le domaine Medical, où le modèle se classe dans le premier quart des modèles évalués. Cette orientation, associée à la prise en charge de 100 langues, convient aux corpus multilingues européens ainsi qu’à la recherche d’informations cliniques, biomédicales ou liées à la santé grand public. Le track Farsi montre également un positionnement relativement solide. La licence MIT facilite l’auto-hébergement et l’intégration dans des systèmes propriétaires. La distinction entre les préfixes « query: » et « passage: » permet d’adapter les représentations au rôle du texte dans une recherche.

Limites et points d'attention. Le positionnement est moins favorable sur les tracks Chinese et Chemical, tandis que Spanish reste en milieu de classement. La couverture multilingue peut se dégrader pour les langues disposant de peu de ressources. La limite de 512 tokens impose de découper les documents longs, et tout dépassement est tronqué. Les vecteurs de 1 024 dimensions augmentent le volume des index et le coût de la recherche par rapport à des représentations plus compactes. Les préfixes requis doivent être appliqués correctement selon l’usage. Usages pertinents : recherche sémantique multilingue, RAG, similarité, bitext mining, classification linéaire et clustering.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).