opensearch-project/opensearch-neural-sparse-encoding-doc-v2-mini

Publié par opensearch-project le 18 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-mini est un modèle d'embedding de 23 millions de paramètres actifs. Il produit des vecteurs lexicaux creux de 30 522 dimensions et bénéficie de la licence ouverte Apache 2.0, qui…

Publié par opensearch-project le 18 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-mini est un modèle d'embedding de 23 millions de paramètres actifs. Il produit des vecteurs lexicaux creux de 30 522 dimensions et bénéficie de la licence ouverte Apache 2.0, qui autorise notamment son auto-hébergement.

Le modèle encode les documents pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Les requêtes sont converties en vecteurs creux avec un tokenizer et une table de poids IDF, puis comparées aux documents par produit scalaire.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuropensearch-project
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 juillet 2024
Dimension du vecteur30 522
Représentationcreuse (sparse/lexicale)
Paramètres23 millions
Paramètres actifs23 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR48,1 %115ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sa spécialité est la recherche d'information à représentation creuse. Cette approche conserve une structure lexicale adaptée aux index inversés Lucene et à une intégration dans un cluster OpenSearch. Le modèle peut aussi être exploité avec Sentence Transformers ou l'API Hugging Face. Sa taille de 23 millions de paramètres reste modeste, tandis que la licence Apache 2.0 facilite le déploiement et la modification dans des environnements auto-hébergés. La pondération IDF des requêtes et le calcul par produit scalaire fournissent un mécanisme explicite de classement des documents.

Limites et points d'attention. Sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes, son classement se situe sous le milieu du tableau, ce qui signale une qualité de retrieval désormais peu compétitive. Ses 30 522 dimensions constituent un espace très large, même si sa nature creuse permet une exploitation par index inversé. Sorti en juillet 2024, il est ancien à l'échelle de l'IA et probablement dépassé par des modèles plus récents de sa catégorie, voire retiré des catalogues actuels. Usages pertinents : recherche lexicale apprise, RAG fondé sur OpenSearch, similarité documentaire et clustering avec représentations creuses.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).