Salesforce/SFR-Embedding-Mistral

Publié par Salesforce le 24 janvier 2024, Salesforce/SFR-Embedding-Mistral est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Issu d’E5-mistral-7b-instruct et de Mistral-7B-v0.1, il représente chaque texte par un vecteur unique de 4 096 dimensions.

Publié par Salesforce le 24 janvier 2024, Salesforce/SFR-Embedding-Mistral est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Issu d’E5-mistral-7b-instruct et de Mistral-7B-v0.1, il représente chaque texte par un vecteur unique de 4 096 dimensions.

Le modèle couvre plusieurs langues et accepte jusqu’à 4 096 tokens dans l’exemple d’utilisation avec Transformers. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Sa licence CC-BY-NC 4.0 permet un usage ouvert sous attribution, mais exclut les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSalesforce
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie24 janvier 2024
Dimension du vecteur4 096
Représentationdense à vecteur unique
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR59,1 %15ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval44,3 %51ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval18,0 %7ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal47,6 %49ᵉ / 208mteb✅ Mesuré
MTEB: Medical64,5 %7ᵉ / 158mteb✅ Mesuré
MTEB: Legal55,3 %28ᵉ / 157mteb✅ Mesuré
MTEB: European62,6 %9ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French54,5 %24ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German45,1 %71ᵉ / 209mteb✅ Mesuré
MTEB: French67,2 %11ᵉ / 117mteb✅ Mesuré
MTEB: Dutch62,6 %12ᵉ / 113mteb✅ Mesuré
MTEB: Indic59,4 %30ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Salesforce/SFR-Embedding-Mistral se distingue surtout sur le Medical et le European de MTEB, où il figure parmi les dix premiers. Il reste également bien placé en français, en néerlandais et sur BEIR, ce qui indique de bonnes aptitudes pour la recherche d’information généraliste, médicale et multilingue. Sa fenêtre de 4 096 tokens facilite l’encodage de passages relativement longs. Les embeddings sont obtenus par pooling du dernier token, puis peuvent être normalisés en L2 et comparés par produit matriciel ou similarité cosinus. En recherche de passages, une instruction décrivant la tâche accompagne la requête, tandis que les documents sont encodés sans instruction.

Limites et points d’attention. Le track Indic est moins favorable que ses résultats européens et médicaux. Les vecteurs de 4 096 dimensions alourdissent aussi les index et rendent la recherche plus coûteuse que des représentations plus compactes. La licence CC-BY-NC 4.0 restreint l’exploitation commerciale. Sorti il y a environ deux ans, âge très élevé à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : RAG non commercial, recherche sémantique multilingue, recherche médicale, similarité et clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).