opensearch-project/opensearch-neural-sparse-encoding-doc-v2-distill

Publié par opensearch-project le 17 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0…

Publié par opensearch-project le 17 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.

Le modèle encode les documents sous forme de vecteurs creux. Les requêtes sont représentées avec un tokenizer et une table de poids IDF, puis rapprochées des documents par produit scalaire. Cette architecture vise la recherche sémantique, la récupération de passages pour le RAG, la mesure de similarité et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuropensearch-project
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 juillet 2024
Dimension du vecteur30 522
Représentationcreuse (sparse/lexicale)
Paramètres66 millions
Paramètres actifs66 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR48,8 %112ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le modèle est spécialisé dans la recherche d’information avec une représentation creuse apprise, adaptée à un index inversé Lucene au sein d’un cluster OpenSearch. Son évaluation sur BEIR porte sur la recherche zero-shot dans des tâches et domaines hétérogènes, ce qui correspond directement à son usage principal. Il peut aussi fonctionner hors cluster avec Sentence Transformers et l’API de modèles Hugging Face. La licence Apache 2.0 facilite l’auto-hébergement, la modification et les usages commerciaux.

Limites et points d’attention. Le résultat BEIR, classé 112e sur 192, place le modèle dans la partie basse du comparatif plutôt que parmi les références du retrieval. Les 30 522 dimensions imposent un espace vectoriel très large, même si la représentation creuse évite de stocker systématiquement chaque valeur. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents ou retiré de certains catalogues. Usages pertinents : recherche documentaire sparse dans OpenSearch, récupération de passages pour le RAG, similarité lexicale enrichie et clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).