opensearch-project/opensearch-neural-sparse-encoding-doc-v3-distill

Publié le 28 mars 2025 par opensearch-project, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0…

Publié le 28 mars 2025 par opensearch-project, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Le modèle encode les documents en vecteurs creux. Les requêtes sont transformées avec un tokenizer et une table de poids IDF, puis comparées aux documents par produit scalaire. Cette architecture cible la recherche sémantique, la récupération documentaire pour le RAG, la similarité et le clustering. Elle s’intègre à Sentence Transformers, à l’API Hugging Face et à OpenSearch avec un index inversé Lucene.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuropensearch-project
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie28 mars 2025
Dimension du vecteur30 522
Représentationcreuse (sparse/lexicale)
Paramètres66 millions
Paramètres actifs66 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR50,0 %101ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. La spécialisation dans la recherche creuse apprise constitue son principal intérêt. Sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe dans la seconde moitié du classement, ce qui indique une qualité exploitable mais non dominante. La représentation lexicale creuse peut s’appuyer sur les mécanismes éprouvés des index inversés Lucene, tandis que le produit scalaire fournit une méthode directe de classement. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration à une infrastructure OpenSearch.

Limites et points d’attention. Avec 30 522 dimensions, la représentation possède un espace de sortie très large. Son caractère creux atténue ce coût, mais la taille réelle de l’index et la vitesse de recherche dépendent du nombre de valeurs non nulles conservées. Son rang sur BEIR ne le place pas parmi les références les plus performantes de la recherche généraliste. Son ancienneté d’environ un an est déjà importante à l’échelle de l’IA et justifie une comparaison avec les embeddings plus récents de sa catégorie. Usages pertinents : recherche documentaire creuse, récupération pour RAG et déploiements OpenSearch reposant sur Lucene.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).