deepvk/USER2-small
Publié par deepvk le 19 avril 2025 sous licence ouverte Apache 2.0, deepvk/USER2-small est un encodeur de phrases de 34 millions de paramètres, tous actifs. Fondé sur RuModernBERT-small, il produit des embeddings denses de 384 dimensions et accepte des séquences allant jusqu’à 8 192…
Publié par deepvk le 19 avril 2025 sous licence ouverte Apache 2.0, deepvk/USER2-small est un encodeur de phrases de 34 millions de paramètres, tous actifs. Fondé sur RuModernBERT-small, il produit des embeddings denses de 384 dimensions et accepte des séquences allant jusqu’à 8 192 tokens.
Orienté vers le russe, son entraînement mobilise aussi des données anglaises et des corpus parallèles anglais-russe. Il sert à indexer et comparer des textes pour la recherche sémantique, le RAG, le clustering, la classification et le reranking. Ses représentations Matryoshka peuvent être tronquées à 32, 64, 128 ou 256 dimensions.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | deepvk |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 19 avril 2025 |
| Dimension du vecteur | 384 |
| Représentation | dense avec dimensions Matryoshka tronquables (32, 64, 128, 256 ou 384) |
| Paramètres | 34 millions |
| Paramètres actifs | 34 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Russian | 58,5 % | 30ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Russian
Notre analyse
Forces. deepvk/USER2-small couvre plusieurs tâches sémantiques en russe, notamment la classification, le clustering, la recherche d’information et le reranking. Son résultat sur MTEB Russian le place dans le premier tiers des modèles évalués, ce qui indique une qualité compétitive, sans le situer parmi les tout meilleurs. La fenêtre de 8 192 tokens facilite l’encodage de documents relativement longs. Les dimensions Matryoshka permettent d’alléger les index et d’accélérer la recherche en réduisant la taille des vecteurs. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d'attention. Sorti il y a environ un an, le modèle est déjà ancien à l’échelle de l’IA et peut être dépassé par des encodeurs russes plus récents. Son positionnement MTEB Russian reste éloigné de la tête du classement. L’orientation prioritaire vers le russe rend son intérêt moins direct pour des corpus couvrant de nombreuses autres langues. La troncature des vecteurs réduit le stockage et le coût de recherche, mais impose un arbitrage avec la richesse de la représentation. Usages pertinents : recherche sémantique, RAG, clustering, classification et reranking sur des corpus principalement russophones.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).