intfloat/e5-small

Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/e5-small est un modèle d’embedding anglophone de 33 millions de paramètres. Son architecture à 12 couches transforme les textes en vecteurs denses de 384 dimensions, obtenus par pooling moyen des derniers états…

Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/e5-small est un modèle d’embedding anglophone de 33 millions de paramètres. Son architecture à 12 couches transforme les textes en vecteurs denses de 384 dimensions, obtenus par pooling moyen des derniers états cachés puis normalisation L2. Les entrées sont limitées à 512 tokens.

Le modèle sert à la recherche sémantique, au RAG, à la détection de paraphrases, à la classification linéaire et au clustering. La recherche asymétrique distingue requêtes et documents grâce aux préfixes « query: » et « passage: ». Il ne produit pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIntfloat
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie8 février 2024
Dimension du vecteur384
Représentationdense
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR46,0 %122ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval36,6 %95ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal29,5 %144ᵉ / 208mteb✅ Mesuré
MTEB: Medical37,9 %92ᵉ / 158mteb✅ Mesuré
MTEB: Legal37,8 %97ᵉ / 157mteb✅ Mesuré
MTEB: European47,4 %75ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French22,4 %121ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German20,5 %118ᵉ / 209mteb✅ Mesuré
MTEB: Chemical68,3 %32ᵉ / 41mteb✅ Mesuré
MTEB: French48,1 %71ᵉ / 117mteb✅ Mesuré
MTEB: German39,5 %57ᵉ / 96mteb✅ Mesuré
MTEB: Dutch39,4 %75ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat MTEB du modèle concerne les textes du domaine Chemical, même si son classement reste dans la partie basse du panel évalué. Sa taille réduite et ses vecteurs de 384 dimensions permettent de constituer des index relativement compacts. Les préfixes dédiés facilitent la recherche asymétrique, tandis que la normalisation L2 prépare directement les représentations aux calculs de similarité. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Malgré des évaluations en français et dans plusieurs ensembles européens, intfloat/e5-small fonctionne uniquement avec des textes anglais. Ses positions sur MTEB French, European, German et Dutch se situent globalement dans la moitié basse des classements. Le résultat BEIR est également faible relativement aux modèles évalués, ce qui limite son intérêt pour la recherche zero-shot sur des tâches et domaines hétérogènes. La troncature à 512 tokens impose de découper les documents longs. Sorti il y a environ deux ans, un âge très important dans ce secteur, il est probablement dépassé par des embeddings plus récents et souvent retiré des catalogues actuels. Usages pertinents : recherche sémantique anglophone légère, petit RAG, similarité et clustering sur des textes courts.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).