deepvk/USER-bge-m3

Publié par deepvk le 5 juillet 2024 sous licence ouverte Apache 2.0, deepvk/USER-bge-m3 est un modèle d’embedding dense de 359 millions de paramètres, tous actifs. Il transforme phrases et paragraphes en vecteurs de 1 024 dimensions.

Publié par deepvk le 5 juillet 2024 sous licence ouverte Apache 2.0, deepvk/USER-bge-m3 est un modèle d’embedding dense de 359 millions de paramètres, tous actifs. Il transforme phrases et paragraphes en vecteurs de 1 024 dimensions.

Destiné exclusivement au russe, il sert à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité et au clustering. Il repose sur TatonkaHF/bge-m3_en_ru, avec des affinages distincts sur des données symétriques et asymétriques, puis une fusion avec bge-m3 au moyen de LM-Cocktail.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurdeepvk
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie5 juillet 2024
Dimension du vecteur1 024
Représentationdense
Paramètres359 millions
Paramètres actifs359 millions
Longueur de séquence max8 194 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval59,4 %35ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal42,5 %72ᵉ / 208mteb✅ Mesuré
MTEB: Medical42,9 %55ᵉ / 158mteb✅ Mesuré
MTEB: Legal47,4 %48ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French46,5 %56ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German45,9 %66ᵉ / 209mteb✅ Mesuré
MTEB: Russian62,9 %19ᵉ / 104mteb✅ Mesuré
MTEB: French58,2 %26ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

bge-m359 %
▶ deepvk/USER-bge-m359 %

MTEB: Russian

▶ deepvk/USER-bge-m363 %
bge-m362 %

Notre analyse

Forces. Le meilleur résultat relatif de deepvk/USER-bge-m3 apparaît sur MTEB Russian, où il se place dans le premier cinquième du classement pour des tâches comprenant classification, clustering et reranking. Ses positions sur MTEB French et MTEB Long-context Retrieval restent également solides, ce qui indique une capacité utile pour la similarité en français et la recherche dans des contenus étendus, malgré son orientation russe. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG.

Limites et points d'attention. Les résultats sont moins favorables sur MTEB Legal ainsi que sur RTEB French et RTEB German, où le modèle se situe davantage en milieu de tableau pour la recherche juridique, généraliste, médicale ou professionnelle. Les vecteurs de 1 024 dimensions alourdissent l’index et rendent la recherche plus coûteuse que des représentations plus petites. Âgé d’environ deux ans, il appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues d’éditeurs. Usages pertinents : recherche sémantique, RAG et clustering principalement sur des corpus russes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).