Intfloat: E5-Large-v2

Intfloat: E5-Large-v2 est un modèle d’embedding anglophone de 335 millions de paramètres, publié par Intfloat le 18 novembre 2025 sous licence ouverte MIT. Son architecture à 24 couches transforme les textes en vecteurs denses de 1 024 dimensions, avec pooling moyen et normalisation L2.…

Intfloat: E5-Large-v2 est un modèle d’embedding anglophone de 335 millions de paramètres, publié par Intfloat le 18 novembre 2025 sous licence ouverte MIT. Son architecture à 24 couches transforme les textes en vecteurs denses de 1 024 dimensions, avec pooling moyen et normalisation L2. Les entrées sont limitées à 512 tokens.

Le modèle sert à la recherche sémantique, au RAG, à la détection de similarités et au clustering. La recherche asymétrique distingue les préfixes « query: » et « passage: », tandis que les autres tâches utilisent « query: ». Il s’intègre à Transformers et Sentence Transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIntfloat
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur1 024
Représentationdense
Paramètres335 millions
Paramètres actifs335 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR50,6 %94ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval42,9 %56ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal33,9 %107ᵉ / 208mteb✅ Mesuré
MTEB: Medical41,2 %62ᵉ / 158mteb✅ Mesuré
MTEB: Legal41,7 %66ᵉ / 157mteb✅ Mesuré
MTEB: European50,4 %49ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French29,6 %92ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German27,2 %100ᵉ / 209mteb✅ Mesuré
MTEB: Chemical69,2 %24ᵉ / 41mteb✅ Mesuré
MTEB: French51,9 %48ᵉ / 117mteb✅ Mesuré
MTEB: German45,7 %30ᵉ / 96mteb✅ Mesuré
MTEB: Dutch43,1 %54ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,01 $

Prix en dollars US par million de tokens.

Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Le meilleur résultat MTEB d’Intfloat: E5-Large-v2 concerne Chemical, ce qui en fait son domaine d’évaluation le plus convaincant. Ses positions sur les tracks German, European et French montrent aussi une capacité mesurable sur des évaluations européennes, même si son fonctionnement est limité aux textes anglais. La licence MIT facilite l’auto-hébergement et l’intégration dans des applications commerciales. La compatibilité avec Transformers et Sentence Transformers simplifie son déploiement, tandis que la normalisation L2 convient aux calculs de similarité. Son tarif d’entrée se situe 78 % sous la moyenne des modèles d’embedding similaires.

Limites et points d’attention. BEIR place le modèle autour du milieu du classement en recherche zero-shot sur des tâches et domaines hétérogènes. Dutch figure également parmi ses résultats les moins favorables, et les évaluations French et European ne compensent pas sa restriction pratique à l’anglais. La limite de 512 tokens impose de découper les documents longs avant indexation. Les vecteurs de 1 024 dimensions rendent aussi les index plus volumineux et la recherche plus coûteuse que des représentations plus compactes. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, similarité, classification par sondage linéaire et clustering.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).