Intfloat: Multilingual-E5-Large
Intfloat: Multilingual-E5-Large est un modèle d’embedding multilingue publié par Intfloat sous licence ouverte MIT. Initialisé depuis XLM-RoBERTa-Large, il compte 560 millions de paramètres répartis sur 24 couches et produit des vecteurs denses de 1 024 dimensions.
Intfloat: Multilingual-E5-Large est un modèle d’embedding multilingue publié par Intfloat sous licence ouverte MIT. Initialisé depuis XLM-RoBERTa-Large, il compte 560 millions de paramètres répartis sur 24 couches et produit des vecteurs denses de 1 024 dimensions.
Le modèle couvre 100 langues et traite jusqu’à 512 tokens, les textes plus longs étant tronqués. Il transforme les requêtes et les passages en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité, à la recherche de paraphrases, au bitext mining, à la classification linéaire et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 18 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 560 millions |
| Paramètres actifs | 560 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,5 % | 82ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 45,9 % | 3ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 40,4 % | 70ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 38,1 % | 86ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 54,2 % | 49ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 56,6 % | 32ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 48,4 % | 47ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 58,3 % | 27ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 47,0 % | 55ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 43,2 % | 78ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 68,3 % | 33ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: Spanish | 64,7 % | 16ᵉ / 27 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,01 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Les résultats MTEB les plus favorables se trouvent sur le track European et dans le domaine Medical, où le modèle se classe dans le premier quart des modèles évalués. Cette orientation, associée à la prise en charge de 100 langues, convient aux corpus multilingues européens ainsi qu’à la recherche d’informations cliniques, biomédicales ou liées à la santé grand public. Le track Farsi montre également un positionnement relativement solide. La licence MIT facilite l’auto-hébergement et l’intégration dans des systèmes propriétaires. La distinction entre les préfixes « query: » et « passage: » permet d’adapter les représentations au rôle du texte dans une recherche.
Limites et points d'attention. Le positionnement est moins favorable sur les tracks Chinese et Chemical, tandis que Spanish reste en milieu de classement. La couverture multilingue peut se dégrader pour les langues disposant de peu de ressources. La limite de 512 tokens impose de découper les documents longs, et tout dépassement est tronqué. Les vecteurs de 1 024 dimensions augmentent le volume des index et le coût de la recherche par rapport à des représentations plus compactes. Les préfixes requis doivent être appliqués correctement selon l’usage. Usages pertinents : recherche sémantique multilingue, RAG, similarité, bitext mining, classification linéaire et clustering.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).