opensearch-project/opensearch-neural-sparse-encoding-doc-v2-distill
Publié par opensearch-project le 17 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0…
Publié par opensearch-project le 17 juillet 2024, opensearch-project/opensearch-neural-sparse-encoding-doc-v2-distill est un modèle d’embedding de 66 millions de paramètres, tous actifs. Il produit une représentation lexicale creuse de 30 522 dimensions. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.
Le modèle encode les documents sous forme de vecteurs creux. Les requêtes sont représentées avec un tokenizer et une table de poids IDF, puis rapprochées des documents par produit scalaire. Cette architecture vise la recherche sémantique, la récupération de passages pour le RAG, la mesure de similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | opensearch-project |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 juillet 2024 |
| Dimension du vecteur | 30 522 |
| Représentation | creuse (sparse/lexicale) |
| Paramètres | 66 millions |
| Paramètres actifs | 66 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 48,8 % | 112ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Le modèle est spécialisé dans la recherche d’information avec une représentation creuse apprise, adaptée à un index inversé Lucene au sein d’un cluster OpenSearch. Son évaluation sur BEIR porte sur la recherche zero-shot dans des tâches et domaines hétérogènes, ce qui correspond directement à son usage principal. Il peut aussi fonctionner hors cluster avec Sentence Transformers et l’API de modèles Hugging Face. La licence Apache 2.0 facilite l’auto-hébergement, la modification et les usages commerciaux.
Limites et points d’attention. Le résultat BEIR, classé 112e sur 192, place le modèle dans la partie basse du comparatif plutôt que parmi les références du retrieval. Les 30 522 dimensions imposent un espace vectoriel très large, même si la représentation creuse évite de stocker systématiquement chaque valeur. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents ou retiré de certains catalogues. Usages pertinents : recherche documentaire sparse dans OpenSearch, récupération de passages pour le RAG, similarité lexicale enrichie et clustering de documents.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).