Intfloat: E5-Large-v2
Intfloat: E5-Large-v2 est un modèle d’embedding anglophone de 335 millions de paramètres, publié par Intfloat le 18 novembre 2025 sous licence ouverte MIT. Son architecture à 24 couches transforme les textes en vecteurs denses de 1 024 dimensions, avec pooling moyen et normalisation L2.…
Intfloat: E5-Large-v2 est un modèle d’embedding anglophone de 335 millions de paramètres, publié par Intfloat le 18 novembre 2025 sous licence ouverte MIT. Son architecture à 24 couches transforme les textes en vecteurs denses de 1 024 dimensions, avec pooling moyen et normalisation L2. Les entrées sont limitées à 512 tokens.
Le modèle sert à la recherche sémantique, au RAG, à la détection de similarités et au clustering. La recherche asymétrique distingue les préfixes « query: » et « passage: », tandis que les autres tâches utilisent « query: ». Il s’intègre à Transformers et Sentence Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Intfloat |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 18 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,6 % | 94ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 42,9 % | 56ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 33,9 % | 107ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 41,2 % | 62ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 41,7 % | 66ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 50,4 % | 49ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 29,6 % | 92ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 27,2 % | 100ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 69,2 % | 24ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 51,9 % | 48ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 45,7 % | 30ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 43,1 % | 54ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,01 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Le meilleur résultat MTEB d’Intfloat: E5-Large-v2 concerne Chemical, ce qui en fait son domaine d’évaluation le plus convaincant. Ses positions sur les tracks German, European et French montrent aussi une capacité mesurable sur des évaluations européennes, même si son fonctionnement est limité aux textes anglais. La licence MIT facilite l’auto-hébergement et l’intégration dans des applications commerciales. La compatibilité avec Transformers et Sentence Transformers simplifie son déploiement, tandis que la normalisation L2 convient aux calculs de similarité. Son tarif d’entrée se situe 78 % sous la moyenne des modèles d’embedding similaires.
Limites et points d’attention. BEIR place le modèle autour du milieu du classement en recherche zero-shot sur des tâches et domaines hétérogènes. Dutch figure également parmi ses résultats les moins favorables, et les évaluations French et European ne compensent pas sa restriction pratique à l’anglais. La limite de 512 tokens impose de découper les documents longs avant indexation. Les vecteurs de 1 024 dimensions rendent aussi les index plus volumineux et la recherche plus coûteuse que des représentations plus compactes. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, similarité, classification par sondage linéaire et clustering.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).