intfloat/e5-small
Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/e5-small est un modèle d’embedding anglophone de 33 millions de paramètres. Son architecture à 12 couches transforme les textes en vecteurs denses de 384 dimensions, obtenus par pooling moyen des derniers états…
Publié par Intfloat le 8 février 2024 sous licence ouverte MIT, intfloat/e5-small est un modèle d’embedding anglophone de 33 millions de paramètres. Son architecture à 12 couches transforme les textes en vecteurs denses de 384 dimensions, obtenus par pooling moyen des derniers états cachés puis normalisation L2. Les entrées sont limitées à 512 tokens.
Le modèle sert à la recherche sémantique, au RAG, à la détection de paraphrases, à la classification linéaire et au clustering. La recherche asymétrique distingue requêtes et documents grâce aux préfixes « query: » et « passage: ». Il ne produit pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 8 février 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 46,0 % | 122ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 36,6 % | 95ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,5 % | 144ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 37,9 % | 92ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,8 % | 97ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 47,4 % | 75ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 22,4 % | 121ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 20,5 % | 118ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 68,3 % | 32ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 48,1 % | 71ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 39,5 % | 57ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 39,4 % | 75ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat MTEB du modèle concerne les textes du domaine Chemical, même si son classement reste dans la partie basse du panel évalué. Sa taille réduite et ses vecteurs de 384 dimensions permettent de constituer des index relativement compacts. Les préfixes dédiés facilitent la recherche asymétrique, tandis que la normalisation L2 prépare directement les représentations aux calculs de similarité. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Malgré des évaluations en français et dans plusieurs ensembles européens, intfloat/e5-small fonctionne uniquement avec des textes anglais. Ses positions sur MTEB French, European, German et Dutch se situent globalement dans la moitié basse des classements. Le résultat BEIR est également faible relativement aux modèles évalués, ce qui limite son intérêt pour la recherche zero-shot sur des tâches et domaines hétérogènes. La troncature à 512 tokens impose de découper les documents longs. Sorti il y a environ deux ans, un âge très important dans ce secteur, il est probablement dépassé par des embeddings plus récents et souvent retiré des catalogues actuels. Usages pertinents : recherche sémantique anglophone légère, petit RAG, similarité et clustering sur des textes courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).