deepvk/USER-bge-m3
Publié par deepvk le 5 juillet 2024 sous licence ouverte Apache 2.0, deepvk/USER-bge-m3 est un modèle d’embedding dense de 359 millions de paramètres, tous actifs. Il transforme phrases et paragraphes en vecteurs de 1 024 dimensions.
Publié par deepvk le 5 juillet 2024 sous licence ouverte Apache 2.0, deepvk/USER-bge-m3 est un modèle d’embedding dense de 359 millions de paramètres, tous actifs. Il transforme phrases et paragraphes en vecteurs de 1 024 dimensions.
Destiné exclusivement au russe, il sert à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité et au clustering. Il repose sur TatonkaHF/bge-m3_en_ru, avec des affinages distincts sur des données symétriques et asymétriques, puis une fusion avec bge-m3 au moyen de LM-Cocktail.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | deepvk |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 5 juillet 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 359 millions |
| Paramètres actifs | 359 millions |
| Longueur de séquence max | 8 194 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 59,4 % | 35ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 42,5 % | 72ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 42,9 % | 55ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 47,4 % | 48ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 46,5 % | 56ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 45,9 % | 66ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 62,9 % | 19ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 58,2 % | 26ᵉ / 117 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Russian
Notre analyse
Forces. Le meilleur résultat relatif de deepvk/USER-bge-m3 apparaît sur MTEB Russian, où il se place dans le premier cinquième du classement pour des tâches comprenant classification, clustering et reranking. Ses positions sur MTEB French et MTEB Long-context Retrieval restent également solides, ce qui indique une capacité utile pour la similarité en français et la recherche dans des contenus étendus, malgré son orientation russe. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG.
Limites et points d'attention. Les résultats sont moins favorables sur MTEB Legal ainsi que sur RTEB French et RTEB German, où le modèle se situe davantage en milieu de tableau pour la recherche juridique, généraliste, médicale ou professionnelle. Les vecteurs de 1 024 dimensions alourdissent l’index et rendent la recherche plus coûteuse que des représentations plus petites. Âgé d’environ deux ans, il appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues d’éditeurs. Usages pertinents : recherche sémantique, RAG et clustering principalement sur des corpus russes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).