opensearch-project/opensearch-neural-sparse-encoding-doc-v2-mini
Publié par opensearch-project le 18 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-mini est un modèle d'embedding de 23 millions de paramètres actifs. Il produit des vecteurs lexicaux creux de 30 522 dimensions et bénéficie de la licence ouverte Apache 2.0, qui…
Publié par opensearch-project le 18 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-mini est un modèle d'embedding de 23 millions de paramètres actifs. Il produit des vecteurs lexicaux creux de 30 522 dimensions et bénéficie de la licence ouverte Apache 2.0, qui autorise notamment son auto-hébergement.
Le modèle encode les documents pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Les requêtes sont converties en vecteurs creux avec un tokenizer et une table de poids IDF, puis comparées aux documents par produit scalaire.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | opensearch-project |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 juillet 2024 |
| Dimension du vecteur | 30 522 |
| Représentation | creuse (sparse/lexicale) |
| Paramètres | 23 millions |
| Paramètres actifs | 23 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 48,1 % | 115ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Sa spécialité est la recherche d'information à représentation creuse. Cette approche conserve une structure lexicale adaptée aux index inversés Lucene et à une intégration dans un cluster OpenSearch. Le modèle peut aussi être exploité avec Sentence Transformers ou l'API Hugging Face. Sa taille de 23 millions de paramètres reste modeste, tandis que la licence Apache 2.0 facilite le déploiement et la modification dans des environnements auto-hébergés. La pondération IDF des requêtes et le calcul par produit scalaire fournissent un mécanisme explicite de classement des documents.
Limites et points d'attention. Sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes, son classement se situe sous le milieu du tableau, ce qui signale une qualité de retrieval désormais peu compétitive. Ses 30 522 dimensions constituent un espace très large, même si sa nature creuse permet une exploitation par index inversé. Sorti en juillet 2024, il est ancien à l'échelle de l'IA et probablement dépassé par des modèles plus récents de sa catégorie, voire retiré des catalogues actuels. Usages pertinents : recherche lexicale apprise, RAG fondé sur OpenSearch, similarité documentaire et clustering avec représentations creuses.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).