Salesforce/SFR-Embedding-2_R

Salesforce/SFR-Embedding-2_R est un modèle dense de Salesforce Research, publié le 14 juin 2024. Ses 7 milliards de paramètres, tous actifs, produisent des vecteurs de 4 096 dimensions. Distribué sous licence ouverte CC-BY-NC 4.0, il reste réservé aux usages non commerciaux.

Salesforce/SFR-Embedding-2_R est un modèle dense de Salesforce Research, publié le 14 juin 2024. Ses 7 milliards de paramètres, tous actifs, produisent des vecteurs de 4 096 dimensions. Distribué sous licence ouverte CC-BY-NC 4.0, il reste réservé aux usages non commerciaux.

Ce modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au retrieval pour le RAG, à la mesure de similarité et au clustering. Son entraînement suit plusieurs étapes. En recherche, les requêtes sont précédées d’une instruction en une phrase, tandis que les documents sont encodés sans instruction.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSalesforce
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie14 juin 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR59,8 %11ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval45,9 %48ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal47,9 %46ᵉ / 208mteb✅ Mesuré
MTEB: Medical64,3 %8ᵉ / 158mteb✅ Mesuré
MTEB: Legal55,8 %23ᵉ / 157mteb✅ Mesuré
MTEB: European62,3 %11ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French50,8 %41ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German44,2 %73ᵉ / 209mteb✅ Mesuré
MTEB: Korean68,2 %13ᵉ / 102mteb✅ Mesuré
MTEB: French67,8 %9ᵉ / 117mteb✅ Mesuré
MTEB: Scandinavian65,6 %5ᵉ / 48mteb✅ Mesuré
MTEB: Dutch63,5 %9ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Salesforce/SFR-Embeddin…60 %
zeta-alpha-ai/Zeta-Alph…59 %

MTEB: Long-context Retrieval

▶ Salesforce/SFR-Embeddin…46 %

Notre analyse

Forces. SFR-Embedding-2_R se classe parmi les dix meilleurs modèles évalués sur les tracks MTEB French, Scandinavian, Dutch et Medical. Il se distingue donc sur plusieurs langues européennes, pour des tâches de classification, de clustering et de comparaison de paires, ainsi que pour la recherche d’informations cliniques, biomédicales et de santé grand public. Ses résultats sur MTEB European et BEIR indiquent également une bonne aptitude au retrieval multilingue et à la recherche zero-shot dans des domaines hétérogènes. La licence CC-BY-NC 4.0 autorise l’auto-hébergement dans un cadre non commercial.

Limites et points d'attention. Avec 4 096 valeurs par représentation, les vecteurs occupent davantage d’espace dans un index et rendent la recherche plus coûteuse que des embeddings de dimension inférieure. Les 7 milliards de paramètres actifs impliquent aussi un modèle volumineux à exécuter. La restriction non commerciale de la licence limite son intégration dans des produits ou services marchands. Sorti en 2024, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche sémantique multilingue, RAG non commercial, clustering documentaire et retrieval médical.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).