intfloat/multilingual-e5-small
Publié par Intfloat le 8 février 2024, intfloat/multilingual-e5-small est un modèle d’embedding dense à poids ouverts sous licence MIT. Ses 118 millions de paramètres, répartis sur 12 couches, produisent des vecteurs de 384 dimensions. Les entrées sont limitées à 512 tokens.
Publié par Intfloat le 8 février 2024, intfloat/multilingual-e5-small est un modèle d’embedding dense à poids ouverts sous licence MIT. Ses 118 millions de paramètres, répartis sur 12 couches, produisent des vecteurs de 384 dimensions. Les entrées sont limitées à 512 tokens.
Initialisé à partir de microsoft/Multilingual-MiniLM-L12-H384, il a poursuivi son entraînement sur des données multilingues et prend en charge 100 langues. Il transforme les textes en vecteurs pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Les préfixes « query: » et « passage: » adaptent les entrées aux tâches.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 8 février 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 118 millions |
| Paramètres actifs | 118 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 46,7 % | 120ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 41,1 % | 9ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 38,8 % | 82ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 7,7 % | 27ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB English | 41,3 % | 2ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: RTEB Code | 39,3 % | 2ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 51,3 % | 38ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 53,5 % | 34ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 36,5 % | 91ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 42,4 % | 64ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 51,0 % | 68ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 53,4 % | 41ᵉ / 158 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Sa meilleure tenue relative sur MTEB concerne le coréen, avec des évaluations couvrant notamment la classification, le reranking et la recherche. Le russe se place aussi dans le premier tiers de son classement. La couverture de 100 langues facilite la création d’un même système d’indexation pour plusieurs marchés. Les vecteurs de 384 dimensions produisent des index plus légers que des représentations de plus grande dimension. La licence MIT et les poids ouverts permettent l’auto-hébergement et l’adaptation à des infrastructures internes.
Limites et points d'attention. Le modèle se situe en retrait sur plusieurs tracks MTEB. Il apparaît près du bas du classement en chimie, en espagnol et en polonais, tandis que les langues scandinaves occupent une position intermédiaire basse. Les langues à faibles ressources peuvent subir une dégradation. La limite de 512 tokens impose de découper les documents longs avant leur indexation. À près de deux ans, il appartient à une génération ancienne à l’échelle de l’IA et ses classements indiquent un modèle souvent dépassé. Usages pertinents : recherche multilingue légère, RAG auto-hébergé, similarité et clustering avec des contraintes modérées de stockage.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).