minishlab/M2V_base_glove_subword
Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_glove_subword est un modèle d’embedding dense statique de 103 millions de paramètres. Il produit des vecteurs de 256 dimensions, un format relativement compact pour constituer et interroger un index…
Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_glove_subword est un modèle d’embedding dense statique de 103 millions de paramètres. Il produit des vecteurs de 256 dimensions, un format relativement compact pour constituer et interroger un index sémantique.
Distillé de BAAI/bge-base-en-v1.5, ce modèle Model2Vec repose sur des embeddings réduits par PCA puis pondérés selon une loi de Zipf. À l’inférence, il calcule sur CPU ou GPU la moyenne des embeddings des tokens. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 21 septembre 2024 |
| Dimension du vecteur | 256 |
| Représentation | dense statique |
| Paramètres | 103 millions |
| Paramètres actifs | 103 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 26,2 % | 167ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 28,4 % | 132ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 24,2 % | 177ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 9,0 % | 91ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 20,8 % | 92ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 26,1 % | 125ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 31,0 % | 131ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 37,1 % | 115ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 1,7 % | 197ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 15,4 % | 145ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 33,0 % | 82ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Dutch | 30,6 % | 97ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les évaluations MTEB European et MTEB Indic constituent ses résultats relatifs les plus favorables, ce qui met surtout en avant le traitement de textes dans plusieurs langues pour la classification et le bitext mining. Sa représentation statique simplifie le calcul à l’inférence, fondé sur une moyenne des embeddings de tokens. Les vecteurs de 256 dimensions limitent la taille des index et le coût de leur interrogation par rapport à des représentations plus larges. La licence MIT autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Malgré leurs scores relativement supérieurs, les tracks European et Indic restent associés à des rangs bas. Les résultats sont également faibles sur MTEB Legal et Dutch, sur Long-context Retrieval et, plus encore, sur BEIR pour la recherche zero-shot dans des domaines hétérogènes. La moyenne statique des tokens privilégie la simplicité, mais restitue moins finement l’ordre et le contexte qu’une représentation contextualisée. Sorti en 2024, le modèle appartient désormais à une génération ancienne à l’échelle de l’IA et apparaît probablement dépassé face à des embeddings plus récents. Les usages pertinents sont les index compacts, les prototypes de recherche sémantique et le clustering lorsque la légèreté prime sur la qualité maximale.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).