intfloat/multilingual-e5-large-instruct

Publié par Intfloat sous licence ouverte MIT le 8 février 2024, intfloat/multilingual-e5-large-instruct est un modèle d’embedding dense de 560 millions de paramètres et 24 couches. Initialisé à partir de xlm-roberta-large, il produit des vecteurs de 1 024 dimensions et prend en charge…

Publié par Intfloat sous licence ouverte MIT le 8 février 2024, intfloat/multilingual-e5-large-instruct est un modèle d’embedding dense de 560 millions de paramètres et 24 couches. Initialisé à partir de xlm-roberta-large, il produit des vecteurs de 1 024 dimensions et prend en charge les 100 langues de cette architecture.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, au calcul de similarité et au clustering. Les requêtes sont précédées d’une instruction décrivant la tâche, contrairement aux documents à indexer. La séquence est limitée à 512 tokens, les textes plus longs étant tronqués.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIntfloat
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie8 février 2024
Dimension du vecteur1 024
Représentationdense
Paramètres560 millions
Paramètres actifs560 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR52,7 %67ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL44,4 %6ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval41,8 %63ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal45,6 %61ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare49,0 %53ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance58,6 %48ᵉ / 97mteb✅ Mesuré
MTEB: Medical58,5 %26ᵉ / 158mteb✅ Mesuré
MTEB: Legal54,9 %30ᵉ / 157mteb✅ Mesuré
MTEB: European62,2 %12ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French40,6 %73ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German51,2 %55ᵉ / 209mteb✅ Mesuré
MTEB: Korean70,9 %6ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent le modèle dans le top 10 des évaluations Korean et Indic, qui couvrent notamment la recherche, le reranking, la classification et, pour les langues indiennes, le bitext mining. Il reste également bien placé sur le français et le russe, ce qui confirme l’intérêt de son entraînement multilingue pour des corpus composés de plusieurs langues. La licence MIT facilite l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG sans restriction non commerciale.

Limites et points d’attention. Les résultats Spanish et Thai se situent plutôt au milieu de leurs classements respectifs, tandis que les langues peu dotées peuvent subir une dégradation. La limite de 512 tokens impose de découper les documents longs afin d’éviter leur troncature. Les vecteurs de 1 024 dimensions alourdissent aussi les index et rendent la recherche plus coûteuse que des représentations plus compactes. Sorti il y a environ deux ans, le modèle est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, les modèles de cette période étant souvent retirés des catalogues. Usages pertinents : recherche multilingue, RAG, similarité et clustering sur des passages courts ou préalablement segmentés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).