sentence-transformers/static-retrieval-mrl-en-v1

Publié par Sentence Transformers le 24 octobre 2024 sous licence ouverte Apache 2.0, sentence-transformers/static-retrieval-mrl-en-v1 est un modèle d’embedding anglophone de 31 millions de paramètres. Il produit une représentation dense statique à vecteur unique de 1 024 dimensions.

Publié par Sentence Transformers le 24 octobre 2024 sous licence ouverte Apache 2.0, sentence-transformers/static-retrieval-mrl-en-v1 est un modèle d’embedding anglophone de 31 millions de paramètres. Il produit une représentation dense statique à vecteur unique de 1 024 dimensions.

Le modèle utilise un tokenizer BERT uncased et calcule la moyenne d’embeddings de tokens pré-calculés. Il sert à indexer des phrases ou paragraphes pour la recherche sémantique, le RAG, la mesure de similarité par cosinus et le clustering. L’entraînement Matryoshka autorise la troncature des vecteurs afin d’adapter la taille des index.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSentence Transformers
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie24 octobre 2024
Dimension du vecteur1 024
Représentationdense statique à vecteur unique, avec dimensions tronquables grâce à Matryoshka
Paramètres31 millions
Paramètres actifs31 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR34,1 %155ᵉ / 192mteb✅ Mesuré
MTEB: RTEB Legal35,3 %96ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare20,0 %82ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance37,4 %79ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French8,0 %163ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German38,6 %84ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ sentence-transformers/s…34 %

MTEB: RTEB German

nvidia/Nemotron-3-Embed…77 %
voyageai/voyage-4-large…77 %
▶ sentence-transformers/s…39 %

Notre analyse

Forces. Son meilleur résultat relatif apparaît sur RTEB German, consacré à la recherche dans des contenus juridiques, médicaux et professionnels en allemand, même si le modèle reste conçu pour l’anglais. Sa représentation statique repose sur la moyenne d’embeddings de tokens pré-calculés, une architecture simple pour encoder des textes sans génération. Matryoshka constitue son principal atout pratique : les vecteurs de 1 024 dimensions peuvent être tronqués afin de réduire l’espace de stockage et le coût de recherche. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Les classements sont faibles sur RTEB Finance et RTEB Healthcare, tandis que RTEB Legal se situe autour du milieu de tableau. Les résultats sur BEIR indiquent aussi une capacité limitée en recherche zero-shot sur des tâches et domaines hétérogènes. RTEB French est particulièrement faible, ce qui confirme que ce modèle anglophone n’est pas adapté à la recherche en français. Sans troncature Matryoshka, les vecteurs de 1 024 dimensions alourdissent l’index et les calculs de similarité. Avec environ deux ans d’ancienneté, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : recherche sémantique anglophone, RAG simple, similarité et clustering avec contrainte de déploiement local.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).