deepvk/deberta-v1-base
deepvk/deberta-v1-base est un modèle d’embedding dense publié par deepvk le 7 février 2023 sous licence ouverte Apache 2.0. Ses 124 millions de paramètres, tous actifs, produisent des vecteurs de 768 dimensions. Cet encodeur bidirectionnel DeBERTa a été préentraîné principalement sur du…
deepvk/deberta-v1-base est un modèle d’embedding dense publié par deepvk le 7 février 2023 sous licence ouverte Apache 2.0. Ses 124 millions de paramètres, tous actifs, produisent des vecteurs de 768 dimensions. Cet encodeur bidirectionnel DeBERTa a été préentraîné principalement sur du russe, avec une faible proportion d’autres langues.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Son architecture comprend 12 couches, 12 têtes d’attention et un tokenizer BPE au niveau des octets. Il s’utilise avec AutoTokenizer et AutoModel.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | deepvk |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 février 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 124 millions |
| Paramètres actifs | 124 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 4,6 % | 192ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 4,4 % | 169ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 8,1 % | 206ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 9,2 % | 155ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 9,3 % | 156ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,1 % | 212ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 2,1 % | 209ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 42,6 % | 51ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 26,0 % | 117ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 22,5 % | 110ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 22,2 % | 94ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Korean | 11,8 % | 82ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le principal point fort de deepvk/deberta-v1-base se situe sur les textes russes, domaine dans lequel ses résultats MTEB sont nettement supérieurs à ceux obtenus dans les autres langues évaluées. Le modèle atteint toutefois seulement le milieu du classement Russian, sur un ensemble de tâches couvrant notamment classification, clustering et reranking. Sa licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales. Sa taille de 124 millions de paramètres reste adaptée à des déploiements plus légers que ceux de grands encodeurs, tandis que les vecteurs denses de 768 dimensions conviennent aux index de similarité.
Limites et points d’attention. Les performances MTEB sont très faibles en français, néerlandais, allemand et coréen, avec des positions proches du bas des classements, ce qui limite son intérêt multilingue malgré la présence marginale d’autres langues dans le préentraînement. Le track Legal est également presque en dernière position, rendant le modèle peu adapté à la recherche juridique. Son ancienneté d’environ trois ans est très importante à l’échelle de l’IA, et le modèle est probablement dépassé par des encodeurs plus récents de sa catégorie. L’absence de tête préentraînée impose une utilisation comme encodeur avec AutoTokenizer et AutoModel. Usages pertinents : prototypes auto-hébergés de recherche, similarité ou clustering principalement centrés sur le russe.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).