intfloat/multilingual-e5-large-instruct
Publié par Intfloat sous licence ouverte MIT le 8 février 2024, intfloat/multilingual-e5-large-instruct est un modèle d’embedding dense de 560 millions de paramètres et 24 couches. Initialisé à partir de xlm-roberta-large, il produit des vecteurs de 1 024 dimensions et prend en charge…
Publié par Intfloat sous licence ouverte MIT le 8 février 2024, intfloat/multilingual-e5-large-instruct est un modèle d’embedding dense de 560 millions de paramètres et 24 couches. Initialisé à partir de xlm-roberta-large, il produit des vecteurs de 1 024 dimensions et prend en charge les 100 langues de cette architecture.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, au calcul de similarité et au clustering. Les requêtes sont précédées d’une instruction décrivant la tâche, contrairement aux documents à indexer. La séquence est limitée à 512 tokens, les textes plus longs étant tronqués.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 8 février 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 560 millions |
| Paramètres actifs | 560 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,7 % | 67ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 44,4 % | 6ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 41,8 % | 63ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 45,6 % | 61ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 49,0 % | 53ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 58,6 % | 48ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 58,5 % | 26ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 54,9 % | 30ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 62,2 % | 12ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 40,6 % | 73ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 51,2 % | 55ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Korean | 70,9 % | 6ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Les résultats MTEB placent le modèle dans le top 10 des évaluations Korean et Indic, qui couvrent notamment la recherche, le reranking, la classification et, pour les langues indiennes, le bitext mining. Il reste également bien placé sur le français et le russe, ce qui confirme l’intérêt de son entraînement multilingue pour des corpus composés de plusieurs langues. La licence MIT facilite l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG sans restriction non commerciale.
Limites et points d’attention. Les résultats Spanish et Thai se situent plutôt au milieu de leurs classements respectifs, tandis que les langues peu dotées peuvent subir une dégradation. La limite de 512 tokens impose de découper les documents longs afin d’éviter leur troncature. Les vecteurs de 1 024 dimensions alourdissent aussi les index et rendent la recherche plus coûteuse que des représentations plus compactes. Sorti il y a environ deux ans, le modèle est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, les modèles de cette période étant souvent retirés des catalogues. Usages pertinents : recherche multilingue, RAG, similarité et clustering sur des passages courts ou préalablement segmentés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).