intfloat/e5-small-v2
Publié par Intfloat le 8 février 2024, intfloat/e5-small-v2 est un modèle d'embedding dense de 33 millions de paramètres sous licence ouverte MIT. Son architecture à 12 couches produit des vecteurs compacts de 384 dimensions par average pooling, avec normalisation L2 dans l'exemple…
Publié par Intfloat le 8 février 2024, intfloat/e5-small-v2 est un modèle d'embedding dense de 33 millions de paramètres sous licence ouverte MIT. Son architecture à 12 couches produit des vecteurs compacts de 384 dimensions par average pooling, avec normalisation L2 dans l'exemple d'utilisation.
Strictement anglophone, il accepte jusqu'à 512 tokens avant troncature. Il transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Les préfixes « query: » et « passage: » distinguent les requêtes des documents dans les tâches de recherche asymétriques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 8 février 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 49,0 % | 110ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 40,7 % | 65ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 31,0 % | 134ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,6 % | 86ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,3 % | 88ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 47,4 % | 74ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 20,0 % | 129ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 19,7 % | 122ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 67,9 % | 36ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 47,7 % | 74ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 40,3 % | 52ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 39,9 % | 71ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le positionnement MTEB le plus favorable concerne Long-context Retrieval, où le modèle se situe dans la première moitié du classement malgré sa limite de 512 tokens. Ses résultats sur BEIR indiquent aussi une capacité exploitable en recherche zero-shot sur des tâches et domaines hétérogènes, sans le placer parmi les références de tête. Les vecteurs denses de 384 dimensions permettent de constituer des index relativement légers et de limiter le coût du stockage et de la recherche. La licence MIT facilite par ailleurs l'auto-hébergement et l'intégration dans des produits commerciaux.
Limites et points d'attention. Les évaluations French, European et German restent en milieu ou seconde moitié de tableau, ce qui concorde avec un fonctionnement limité aux textes anglais. Le track Chemical affiche un positionnement proche du bas du classement malgré un score brut élevé. La troncature à 512 tokens impose de découper les documents longs, y compris pour le RAG. Âgé d'environ deux ans, ce modèle appartient à une génération très ancienne à l'échelle de l'IA et probablement dépassée par des embeddings plus récents. Usages pertinents : recherche sémantique anglophone, RAG compact, similarité et clustering sur des passages courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).