deepvk/USER-base
Publié par deepvk le 10 juin 2024 sous licence ouverte Apache 2.0, deepvk/USER-base est un modèle d’embedding de 427 millions de paramètres, tous actifs. Initialisé à partir de deepvk/deberta-v1-base, il est exclusivement conçu pour le russe et produit des représentations denses de 768…
Publié par deepvk le 10 juin 2024 sous licence ouverte Apache 2.0, deepvk/USER-base est un modèle d’embedding de 427 millions de paramètres, tous actifs. Initialisé à partir de deepvk/deberta-v1-base, il est exclusivement conçu pour le russe et produit des représentations denses de 768 dimensions.
Le modèle transforme des phrases et des paragraphes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, au clustering et à la mesure de similarité. Il prend aussi en charge la recherche de paraphrases, le bitext mining et l’extraction de caractéristiques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | deepvk |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 10 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 427 millions |
| Paramètres actifs | 427 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 23,2 % | 174ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 23,5 % | 143ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 19,6 % | 189ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 23,8 % | 130ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 26,2 % | 140ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 2,9 % | 188ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 3,6 % | 199ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 58,3 % | 32ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 37,3 % | 102ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 31,3 % | 80ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Korean | 8,6 % | 84ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le russe constitue clairement son domaine le plus solide dans MTEB, avec un classement nettement meilleur que sur les autres tracks évalués. Le modèle couvre plusieurs usages d’embedding, notamment la classification, le clustering, le reranking et la recherche par similarité. Les préfixes « query: » et « passage: » structurent les tâches de recherche asymétrique, tandis que « query: » sert aux tâches symétriques ou hors recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux. Les vecteurs denses de 768 dimensions offrent un format standard pour construire un index sémantique.
Limites et points d'attention. Les résultats MTEB sont faibles en français et en allemand, ce qui confirme une spécialisation russe plutôt qu’une réelle couverture multilingue. Les tracks Legal, Medical et Long-context Retrieval figurent également près du bas de leurs classements respectifs. La dimension de 768 influe directement sur le stockage de l’index et le coût des recherches à grande échelle. Sorti il y a environ deux ans, deepvk/USER-base appartient à une génération déjà ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible d’avoir quitté certains catalogues. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des phrases ou paragraphes russes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).