intfloat/e5-mistral-7b-instruct

intfloat/e5-mistral-7b-instruct est un modèle d’embedding dense d’Intfloat, doté de 7 milliards de paramètres et de 32 couches. Initialisé depuis Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions et accepte une longueur d’entrée recommandée allant jusqu’à 4 096 tokens.

intfloat/e5-mistral-7b-instruct est un modèle d’embedding dense d’Intfloat, doté de 7 milliards de paramètres et de 32 couches. Initialisé depuis Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions et accepte une longueur d’entrée recommandée allant jusqu’à 4 096 tokens.

Ses poids ouverts et sa licence MIT autorisent l’auto-hébergement. Affiné sur des données multilingues, il conserve certaines capacités dans plusieurs langues, même si son usage est recommandé en anglais. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIntfloat
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie8 février 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR57,1 %25ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval43,7 %54ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval17,5 %11ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal46,6 %56ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare61,2 %32ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance51,0 %68ᵉ / 97mteb✅ Mesuré
MTEB: Medical62,7 %13ᵉ / 158mteb✅ Mesuré
MTEB: Legal54,3 %33ᵉ / 157mteb✅ Mesuré
MTEB: European61,3 %17ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French54,4 %27ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German44,4 %72ᵉ / 209mteb✅ Mesuré
MTEB: French67,2 %10ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le modèle se place dans le top 10 de MTEB en français et en russe. Il obtient aussi de bons rangs sur les tracks scandinave et européen, ce qui souligne son intérêt pour la classification, le clustering, la similarité et le reranking multilingues. Son classement sur MTEB Medical est également solide pour la recherche d’informations cliniques, biomédicales et de santé grand public. La limite recommandée de 4 096 tokens facilite l’indexation de passages ou de documents assez longs. Les poids ouverts sous licence MIT permettent un déploiement auto-hébergé avec Sentence Transformers ou Transformers.

Limites et points d'attention. Malgré ses résultats multilingues, l’usage recommandé reste limité à l’anglais. Chaque requête doit recevoir une instruction d’une phrase décrivant la tâche, alors que les documents sont encodés sans instruction. Les vecteurs de 4 096 dimensions alourdissent les index et rendent la recherche plus coûteuse. Les 7 milliards de paramètres augmentent aussi les besoins de déploiement. Le track RTEB Healthcare est plus en retrait que MTEB Medical. Sorti en février 2024, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Les usages pertinents sont la recherche sémantique anglophone, le RAG auto-hébergé et les corpus multilingues nécessitant une validation préalable.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).