opensearch-project/opensearch-neural-sparse-encoding-doc-v3-gte

Publié par opensearch-project le 18 juin 2025, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-gte est un modèle d’embedding de 137 millions de paramètres, tous actifs. Sous licence ouverte Apache 2.0, il encode les documents sous forme de vecteurs lexicaux creux de 30 522…

Publié par opensearch-project le 18 juin 2025, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-gte est un modèle d’embedding de 137 millions de paramètres, tous actifs. Sous licence ouverte Apache 2.0, il encode les documents sous forme de vecteurs lexicaux creux de 30 522 dimensions.

Le modèle sert principalement à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Les dimensions non nulles représentent des tokens du vocabulaire, tandis que leurs valeurs traduisent leur importance. La proximité entre une requête et un document est calculée par produit scalaire.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuropensearch-project
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 juin 2025
Dimension du vecteur30 522
Représentationcreuse (sparse/lexicale)
Paramètres137 millions
Paramètres actifs137 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR52,7 %68ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ opensearch-project/open…53 %
llmrails/ember-v152 %

Notre analyse

Forces. Son résultat sur BEIR le situe dans la partie supérieure du classement pour la recherche zero-shot sur des tâches et domaines hétérogènes, sans le placer parmi les tout premiers modèles. Son principal atout opérationnel réside dans le traitement des requêtes : un tokenizer et une table de poids IDF produisent leur représentation creuse sans exécuter le modèle pendant la recherche. Cette architecture se prête à un index inversé Lucene dans OpenSearch et reste également exploitable avec Sentence Transformers ou l’API Hugging Face. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Avec 30 522 dimensions, l’espace de représentation est vaste, même si sa nature creuse évite de manipuler chaque dimension pour chaque texte. Le coût réel de l’index dépend donc du nombre de tokens non nuls et de la taille du corpus. Son rang sur BEIR indique une qualité de retrieval solide, mais dépassée par plusieurs dizaines de concurrents. Son ancienneté, très longue à l’échelle de l’IA, le place face à des modèles plus récents et probablement plus performants, tandis que les modèles de cette période sont souvent retirés des catalogues. Usages pertinents : recherche sparse dans OpenSearch, RAG fondé sur Lucene, similarité lexicale pondérée et clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).