opensearch-project/opensearch-neural-sparse-encoding-doc-v3-distill
Publié le 28 mars 2025 par opensearch-project, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0…
Publié le 28 mars 2025 par opensearch-project, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Le modèle encode les documents en vecteurs creux. Les requêtes sont transformées avec un tokenizer et une table de poids IDF, puis comparées aux documents par produit scalaire. Cette architecture cible la recherche sémantique, la récupération documentaire pour le RAG, la similarité et le clustering. Elle s’intègre à Sentence Transformers, à l’API Hugging Face et à OpenSearch avec un index inversé Lucene.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | opensearch-project |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 28 mars 2025 |
| Dimension du vecteur | 30 522 |
| Représentation | creuse (sparse/lexicale) |
| Paramètres | 66 millions |
| Paramètres actifs | 66 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,0 % | 101ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. La spécialisation dans la recherche creuse apprise constitue son principal intérêt. Sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe dans la seconde moitié du classement, ce qui indique une qualité exploitable mais non dominante. La représentation lexicale creuse peut s’appuyer sur les mécanismes éprouvés des index inversés Lucene, tandis que le produit scalaire fournit une méthode directe de classement. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration à une infrastructure OpenSearch.
Limites et points d’attention. Avec 30 522 dimensions, la représentation possède un espace de sortie très large. Son caractère creux atténue ce coût, mais la taille réelle de l’index et la vitesse de recherche dépendent du nombre de valeurs non nulles conservées. Son rang sur BEIR ne le place pas parmi les références les plus performantes de la recherche généraliste. Son ancienneté d’environ un an est déjà importante à l’échelle de l’IA et justifie une comparaison avec les embeddings plus récents de sa catégorie. Usages pertinents : recherche documentaire creuse, récupération pour RAG et déploiements OpenSearch reposant sur Lucene.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).