intfloat/e5-base
Publié par Intfloat le 26 décembre 2022 sous licence ouverte Apache 2.0, intfloat/e5-base est un modèle d'embedding dense de 109 millions de paramètres. Ses 12 couches produisent des vecteurs de 768 dimensions par pooling moyen, avec normalisation L2.
Publié par Intfloat le 26 décembre 2022 sous licence ouverte Apache 2.0, intfloat/e5-base est un modèle d'embedding dense de 109 millions de paramètres. Ses 12 couches produisent des vecteurs de 768 dimensions par pooling moyen, avec normalisation L2.
Strictement anglophone, il traite jusqu'à 512 tokens et distingue requêtes et passages grâce aux préfixes « query: » et « passage: ». Il sert à la recherche sémantique, à la couche de recherche d'un système RAG, à la détection de paraphrases, à la similarité, à la classification linéaire et au clustering. Il ne génère pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 26 décembre 2022 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 48,7 % | 113ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 37,6 % | 88ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,6 % | 143ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 40,8 % | 69ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,0 % | 103ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 48,6 % | 65ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 27,6 % | 101ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 22,8 % | 112ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 69,1 % | 27ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 49,3 % | 64ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 41,2 % | 63ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 41,0 % | 46ᵉ / 96 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son résultat MTEB le plus favorable concerne les textes du domaine chimique, même si son classement reste éloigné du groupe de tête. Les évaluations French et European le placent plutôt au milieu des modèles testés, ce qui indique une certaine transférabilité multilingue malgré un fonctionnement prévu uniquement pour l'anglais. Ses 109 millions de paramètres et ses vecteurs de 768 dimensions offrent un format relativement contenu pour constituer un index. La licence Apache 2.0 facilite l'auto-hébergement et l'intégration dans des applications commerciales.
Limites et points d'attention. Sur BEIR, consacré à la recherche zero-shot dans des tâches et domaines hétérogènes, intfloat/e5-base se situe dans la moitié inférieure du classement. Les résultats Dutch et German restent intermédiaires, sans en faire un choix multilingue de premier plan. La limite de 512 tokens impose de découper les documents longs, tandis que 768 dimensions alourdissent davantage l'index et la recherche que des représentations plus petites. Âgé d'environ quatre ans, il appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, similarité, classification et clustering dans un déploiement maîtrisé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).