deepvk/deberta-v1-base

deepvk/deberta-v1-base est un modèle d’embedding dense publié par deepvk le 7 février 2023 sous licence ouverte Apache 2.0. Ses 124 millions de paramètres, tous actifs, produisent des vecteurs de 768 dimensions. Cet encodeur bidirectionnel DeBERTa a été préentraîné principalement sur du…

deepvk/deberta-v1-base est un modèle d’embedding dense publié par deepvk le 7 février 2023 sous licence ouverte Apache 2.0. Ses 124 millions de paramètres, tous actifs, produisent des vecteurs de 768 dimensions. Cet encodeur bidirectionnel DeBERTa a été préentraîné principalement sur du russe, avec une faible proportion d’autres langues.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Son architecture comprend 12 couches, 12 têtes d’attention et un tokenizer BPE au niveau des octets. Il s’utilise avec AutoTokenizer et AutoModel.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurdeepvk
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie7 février 2023
Dimension du vecteur768
Représentationdense
Paramètres124 millions
Paramètres actifs124 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR4,6 %192ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval4,4 %169ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal8,1 %206ᵉ / 208mteb✅ Mesuré
MTEB: Medical9,2 %155ᵉ / 158mteb✅ Mesuré
MTEB: Legal9,3 %156ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French0,1 %212ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German2,1 %209ᵉ / 209mteb✅ Mesuré
MTEB: Russian42,6 %51ᵉ / 104mteb✅ Mesuré
MTEB: French26,0 %117ᵉ / 117mteb✅ Mesuré
MTEB: Dutch22,5 %110ᵉ / 113mteb✅ Mesuré
MTEB: German22,2 %94ᵉ / 96mteb✅ Mesuré
MTEB: Korean11,8 %82ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ deepvk/deberta-v1-base5 %

MTEB: Long-context Retrieval

malenia1/ternary-weight…6 %
▶ deepvk/deberta-v1-base4 %

Notre analyse

Forces. Le principal point fort de deepvk/deberta-v1-base se situe sur les textes russes, domaine dans lequel ses résultats MTEB sont nettement supérieurs à ceux obtenus dans les autres langues évaluées. Le modèle atteint toutefois seulement le milieu du classement Russian, sur un ensemble de tâches couvrant notamment classification, clustering et reranking. Sa licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales. Sa taille de 124 millions de paramètres reste adaptée à des déploiements plus légers que ceux de grands encodeurs, tandis que les vecteurs denses de 768 dimensions conviennent aux index de similarité.

Limites et points d’attention. Les performances MTEB sont très faibles en français, néerlandais, allemand et coréen, avec des positions proches du bas des classements, ce qui limite son intérêt multilingue malgré la présence marginale d’autres langues dans le préentraînement. Le track Legal est également presque en dernière position, rendant le modèle peu adapté à la recherche juridique. Son ancienneté d’environ trois ans est très importante à l’échelle de l’IA, et le modèle est probablement dépassé par des encodeurs plus récents de sa catégorie. L’absence de tête préentraînée impose une utilisation comme encodeur avec AutoTokenizer et AutoModel. Usages pertinents : prototypes auto-hébergés de recherche, similarité ou clustering principalement centrés sur le russe.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).