Intfloat: E5-Base-v2
Intfloat: E5-Base-v2 est un modèle d’embedding dense de 109 millions de paramètres publié par Intfloat sous licence ouverte MIT. Son architecture compte 12 couches et produit des vecteurs de 768 dimensions par pooling moyen des états cachés, avec normalisation L2.
Intfloat: E5-Base-v2 est un modèle d’embedding dense de 109 millions de paramètres publié par Intfloat sous licence ouverte MIT. Son architecture compte 12 couches et produit des vecteurs de 768 dimensions par pooling moyen des états cachés, avec normalisation L2.
Limité aux textes anglais et à 512 tokens par entrée, il sert à la recherche sémantique, au RAG, à la détection de paraphrases, à la similarité, à la classification par sondage linéaire et au clustering. Les préfixes « query: » et « passage: » adaptent les entrées aux tâches de recherche de passages.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 18 novembre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,3 % | 96ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 41,1 % | 64ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 32,0 % | 126ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 40,1 % | 74ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,5 % | 84ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,4 % | 56ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 25,4 % | 111ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 22,3 % | 113ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 68,3 % | 34ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 51,1 % | 52ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 42,4 % | 43ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 42,2 % | 61ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,005 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Le track MTEB Chemical constitue son résultat le plus élevé, ce qui indique une aptitude relative aux représentations de textes du domaine chimique. Le modèle obtient aussi des résultats intermédiaires sur MTEB French et BEIR, respectivement consacrés à plusieurs tâches d’embedding en français et à la recherche zero-shot sur des domaines hétérogènes. Sa licence MIT facilite l’auto-hébergement et l’intégration dans des applications commerciales. Son positionnement économique, avec un tarif d’entrée de 0,005 $ par million de tokens et une sortie gratuite, réduit le coût d’indexation.
Limites et points d’attention. Les résultats plus faibles sur les tracks MTEB European, German et Dutch limitent son intérêt pour les corpus multilingues. Malgré son évaluation sur plusieurs langues, son fonctionnement est réservé aux textes anglais. La limite de 512 tokens impose de découper les documents longs avant leur vectorisation, ce qui ajoute une étape aux pipelines RAG. Son classement sur BEIR reste en retrait dans l’ensemble évalué, tandis que les performances Chemical ne le placent pas en tête du track. Usages pertinents : recherche sémantique, RAG, similarité, détection de paraphrases et clustering sur des corpus anglais découpés en passages courts.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).