deepvk/USER2-base
Publié par deepvk le 19 avril 2025 sous licence ouverte Apache 2.0, deepvk/USER2-base est un modèle d’embedding russophone de 149 millions de paramètres, fondé sur RuModernBERT-base. Il accepte jusqu’à 8 192 tokens et produit des vecteurs denses de 768 dimensions.
Publié par deepvk le 19 avril 2025 sous licence ouverte Apache 2.0, deepvk/USER2-base est un modèle d’embedding russophone de 149 millions de paramètres, fondé sur RuModernBERT-base. Il accepte jusqu’à 8 192 tokens et produit des vecteurs denses de 768 dimensions.
Affiné pour la recherche d’information et les tâches sémantiques, il sert à indexer et rapprocher des textes en russe pour la recherche sémantique, le RAG, la similarité et le clustering. Ses représentations Matryoshka peuvent être tronquées à plusieurs dimensions, de 32 à 768, selon le compromis recherché.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | deepvk |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 19 avril 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense avec dimensions Matryoshka tronquables |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Russian | 61,2 % | 24ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Russian
Notre analyse
Forces. deepvk/USER2-base est spécialisé dans les contenus russes et adapté à la recherche, au reranking, à la classification et au clustering. Sur MTEB Russian, qui agrège ces familles de tâches, il se place dans le premier quart du classement observé. Sa fenêtre de 8 192 tokens facilite l’encodage de documents longs. Les dimensions Matryoshka permettent aussi de réduire les vecteurs pour alléger les index et accélérer la recherche, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. À sa dimension maximale de 768, le stockage des index et le calcul de similarité sont plus coûteux qu’avec ses représentations tronquées. Cette réduction apporte toutefois un compromis susceptible de diminuer la qualité sémantique. L’emploi de préfixes distincts pour la classification, le clustering, les requêtes et les documents impose également une préparation cohérente des entrées. Sorti il y a environ un an, un âge très long à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : recherche sémantique, RAG, similarité et clustering de textes russes, notamment sur des documents longs.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).