sentence-transformers/static-retrieval-mrl-en-v1
Publié par Sentence Transformers le 24 octobre 2024 sous licence ouverte Apache 2.0, sentence-transformers/static-retrieval-mrl-en-v1 est un modèle d’embedding anglophone de 31 millions de paramètres. Il produit une représentation dense statique à vecteur unique de 1 024 dimensions.
Publié par Sentence Transformers le 24 octobre 2024 sous licence ouverte Apache 2.0, sentence-transformers/static-retrieval-mrl-en-v1 est un modèle d’embedding anglophone de 31 millions de paramètres. Il produit une représentation dense statique à vecteur unique de 1 024 dimensions.
Le modèle utilise un tokenizer BERT uncased et calcule la moyenne d’embeddings de tokens pré-calculés. Il sert à indexer des phrases ou paragraphes pour la recherche sémantique, le RAG, la mesure de similarité par cosinus et le clustering. L’entraînement Matryoshka autorise la troncature des vecteurs afin d’adapter la taille des index.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 24 octobre 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense statique à vecteur unique, avec dimensions tronquables grâce à Matryoshka |
| Paramètres | 31 millions |
| Paramètres actifs | 31 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 34,1 % | 155ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 35,3 % | 96ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 20,0 % | 82ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 37,4 % | 79ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 8,0 % | 163ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 38,6 % | 84ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: RTEB German
Notre analyse
Forces. Son meilleur résultat relatif apparaît sur RTEB German, consacré à la recherche dans des contenus juridiques, médicaux et professionnels en allemand, même si le modèle reste conçu pour l’anglais. Sa représentation statique repose sur la moyenne d’embeddings de tokens pré-calculés, une architecture simple pour encoder des textes sans génération. Matryoshka constitue son principal atout pratique : les vecteurs de 1 024 dimensions peuvent être tronqués afin de réduire l’espace de stockage et le coût de recherche. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d’attention. Les classements sont faibles sur RTEB Finance et RTEB Healthcare, tandis que RTEB Legal se situe autour du milieu de tableau. Les résultats sur BEIR indiquent aussi une capacité limitée en recherche zero-shot sur des tâches et domaines hétérogènes. RTEB French est particulièrement faible, ce qui confirme que ce modèle anglophone n’est pas adapté à la recherche en français. Sans troncature Matryoshka, les vecteurs de 1 024 dimensions alourdissent l’index et les calculs de similarité. Avec environ deux ans d’ancienneté, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : recherche sémantique anglophone, RAG simple, similarité et clustering avec contrainte de déploiement local.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).