minishlab/M2V_base_glove
Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_glove est un modèle d’embedding dense statique de 102 millions de paramètres, tous actifs. Il produit des vecteurs compacts de 256 dimensions.
Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_glove est un modèle d’embedding dense statique de 102 millions de paramètres, tous actifs. Il produit des vecteurs compacts de 256 dimensions.
Distillé du modèle anglophone BAAI/bge-base-en-v1.5, il représente un texte par la moyenne des embeddings de ses tokens. Ces vecteurs servent à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 21 septembre 2024 |
| Dimension du vecteur | 256 |
| Représentation | dense statique |
| Paramètres | 102 millions |
| Paramètres actifs | 102 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 28,0 % | 164ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 30,8 % | 122ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 22,1 % | 182ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 9,9 % | 90ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 25,5 % | 89ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 22,4 % | 135ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 28,3 % | 137ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 35,5 % | 119ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 1,0 % | 203ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 4,2 % | 194ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 28,9 % | 116ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Korean | 0,3 % | 102ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son meilleur résultat relatif sur MTEB concerne les langues européennes, devant ses évaluations en contexte long et dans les domaines spécialisés. La représentation statique simplifie l’inférence : le vocabulaire est d’abord encodé par le Sentence Transformer d’origine, réduit par PCA et pondéré selon une pondération de Zipf, puis les embeddings des tokens sont moyennés. La dimension de 256 permet de constituer des index plus légers que des représentations de plus grande dimension. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Malgré ce profil compact, le modèle se situe près du bas des classements sur tous les tracks fournis. Les résultats sont particulièrement faibles sur RTEB Finance, BEIR, Legal et Indic, tandis que Long-context Retrieval reste également peu compétitif. Son origine anglophone invite à la prudence pour les corpus multilingues. Sorti il y a près de deux ans, il est ancien à l’échelle de l’IA, probablement dépassé par des embeddings plus récents et susceptible d’avoir quitté les catalogues courants. Usages pertinents : prototypes, index compacts et recherche sémantique anglophone lorsque la simplicité et une licence permissive priment sur la qualité maximale.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).