Intfloat: E5-Base-v2

Intfloat: E5-Base-v2 est un modèle d’embedding dense de 109 millions de paramètres publié par Intfloat sous licence ouverte MIT. Son architecture compte 12 couches et produit des vecteurs de 768 dimensions par pooling moyen des états cachés, avec normalisation L2.

Intfloat: E5-Base-v2 est un modèle d’embedding dense de 109 millions de paramètres publié par Intfloat sous licence ouverte MIT. Son architecture compte 12 couches et produit des vecteurs de 768 dimensions par pooling moyen des états cachés, avec normalisation L2.

Limité aux textes anglais et à 512 tokens par entrée, il sert à la recherche sémantique, au RAG, à la détection de paraphrases, à la similarité, à la classification par sondage linéaire et au clustering. Les préfixes « query: » et « passage: » adaptent les entrées aux tâches de recherche de passages.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIntfloat
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR50,3 %96ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval41,1 %64ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal32,0 %126ᵉ / 208mteb✅ Mesuré
MTEB: Medical40,1 %74ᵉ / 158mteb✅ Mesuré
MTEB: Legal39,5 %84ᵉ / 157mteb✅ Mesuré
MTEB: European49,4 %56ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French25,4 %111ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German22,3 %113ᵉ / 209mteb✅ Mesuré
MTEB: Chemical68,3 %34ᵉ / 41mteb✅ Mesuré
MTEB: French51,1 %52ᵉ / 117mteb✅ Mesuré
MTEB: German42,4 %43ᵉ / 96mteb✅ Mesuré
MTEB: Dutch42,2 %61ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ E5-Base-v250 %
dwzhu/e5-base-4k50 %

MTEB: Long-context Retrieval

manveertamber/cadet-emb…42 %
▶ E5-Base-v241 %

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,005 $

Prix en dollars US par million de tokens.

Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Le track MTEB Chemical constitue son résultat le plus élevé, ce qui indique une aptitude relative aux représentations de textes du domaine chimique. Le modèle obtient aussi des résultats intermédiaires sur MTEB French et BEIR, respectivement consacrés à plusieurs tâches d’embedding en français et à la recherche zero-shot sur des domaines hétérogènes. Sa licence MIT facilite l’auto-hébergement et l’intégration dans des applications commerciales. Son positionnement économique, avec un tarif d’entrée de 0,005 $ par million de tokens et une sortie gratuite, réduit le coût d’indexation.

Limites et points d’attention. Les résultats plus faibles sur les tracks MTEB European, German et Dutch limitent son intérêt pour les corpus multilingues. Malgré son évaluation sur plusieurs langues, son fonctionnement est réservé aux textes anglais. La limite de 512 tokens impose de découper les documents longs avant leur vectorisation, ce qui ajoute une étape aux pipelines RAG. Son classement sur BEIR reste en retrait dans l’ensemble évalué, tandis que les performances Chemical ne le placent pas en tête du track. Usages pertinents : recherche sémantique, RAG, similarité, détection de paraphrases et clustering sur des corpus anglais découpés en passages courts.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).