opensearch-project/opensearch-neural-sparse-encoding-doc-v3-gte
Publié par opensearch-project le 18 juin 2025, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-gte est un modèle d’embedding de 137 millions de paramètres, tous actifs. Sous licence ouverte Apache 2.0, il encode les documents sous forme de vecteurs lexicaux creux de 30 522…
Publié par opensearch-project le 18 juin 2025, opensearch-project/opensearch-neural-sparse-encoding-doc-v3-gte est un modèle d’embedding de 137 millions de paramètres, tous actifs. Sous licence ouverte Apache 2.0, il encode les documents sous forme de vecteurs lexicaux creux de 30 522 dimensions.
Le modèle sert principalement à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Les dimensions non nulles représentent des tokens du vocabulaire, tandis que leurs valeurs traduisent leur importance. La proximité entre une requête et un document est calculée par produit scalaire.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | opensearch-project |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 juin 2025 |
| Dimension du vecteur | 30 522 |
| Représentation | creuse (sparse/lexicale) |
| Paramètres | 137 millions |
| Paramètres actifs | 137 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,7 % | 68ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Son résultat sur BEIR le situe dans la partie supérieure du classement pour la recherche zero-shot sur des tâches et domaines hétérogènes, sans le placer parmi les tout premiers modèles. Son principal atout opérationnel réside dans le traitement des requêtes : un tokenizer et une table de poids IDF produisent leur représentation creuse sans exécuter le modèle pendant la recherche. Cette architecture se prête à un index inversé Lucene dans OpenSearch et reste également exploitable avec Sentence Transformers ou l’API Hugging Face. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d’attention. Avec 30 522 dimensions, l’espace de représentation est vaste, même si sa nature creuse évite de manipuler chaque dimension pour chaque texte. Le coût réel de l’index dépend donc du nombre de tokens non nuls et de la taille du corpus. Son rang sur BEIR indique une qualité de retrieval solide, mais dépassée par plusieurs dizaines de concurrents. Son ancienneté, très longue à l’échelle de l’IA, le place face à des modèles plus récents et probablement plus performants, tandis que les modèles de cette période sont souvent retirés des catalogues. Usages pertinents : recherche sparse dans OpenSearch, RAG fondé sur Lucene, similarité lexicale pondérée et clustering de documents.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).