sergeyzh/rubert-mini-frida
Publié par sergeyzh le 2 mars 2025 sous licence ouverte MIT, sergeyzh/rubert-mini-frida est un modèle d’embedding russe et anglais de 32 millions de paramètres. Distillé à partir des embeddings de FRIDA dans rubert-mini-sts, il repose sur 7 couches et recommande des séquences ne…
Publié par sergeyzh le 2 mars 2025 sous licence ouverte MIT, sergeyzh/rubert-mini-frida est un modèle d’embedding russe et anglais de 32 millions de paramètres. Distillé à partir des embeddings de FRIDA dans rubert-mini-sts, il repose sur 7 couches et recommande des séquences ne dépassant pas 512 tokens.
Le modèle transforme chaque texte en un unique vecteur dense de 312 dimensions par mean pooling. Cette représentation compacte convient à la recherche sémantique, à l’indexation pour le RAG, à la détection de paraphrases, à la similarité et au clustering. Des préfixes spécialisés couvrent aussi la catégorisation, l’inférence, le sentiment et les sujets.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sergeyzh |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 2 mars 2025 |
| Dimension du vecteur | 312 |
| Représentation | dense à vecteur unique avec mean pooling |
| Paramètres | 32 millions |
| Paramètres actifs | 32 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Russian | 63,2 % | 17ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Russian
Notre analyse
Forces. sergeyzh/rubert-mini-frida se place dans le haut du classement MTEB: Russian, avec un résultat global au 17e rang sur 103 modèles pour un ensemble couvrant notamment classification, clustering et reranking. Ce positionnement en fait surtout un encodeur polyvalent pour les traitements sémantiques en russe, avec une prise en charge complémentaire de l’anglais. Ses vecteurs de 312 dimensions permettent de limiter la taille des index et le coût des calculs de similarité. La licence MIT facilite en outre l’auto-hébergement et l’intégration dans des produits commerciaux.
Limites et points d'attention. La recommandation de ne pas dépasser 512 tokens oriente le modèle vers des phrases, requêtes, passages ou documents découpés, plutôt que vers l’encodage direct de longs contenus. Son ancienneté d’environ un an est importante à l’échelle de l’IA, ce qui le situe derrière des générations plus récentes et peut correspondre à un modèle désormais retiré de certains catalogues. Le mean pooling agrège l’ensemble de la séquence dans un seul vecteur, au prix d’une perte de granularité. Usages pertinents : recherche sémantique russe ou bilingue russe-anglais, RAG sur passages courts, regroupement thématique, paraphrase et catégorisation.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).