minishlab/M2V_base_output
Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_output est un modèle d’embedding de 8 millions de paramètres. Il produit un unique vecteur dense statique de 256 dimensions par texte, obtenu en moyennant les embeddings des tokens.
Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_output est un modèle d’embedding de 8 millions de paramètres. Il produit un unique vecteur dense statique de 256 dimensions par texte, obtenu en moyennant les embeddings des tokens.
Distillé de baai/bge-base-en-v1.5, il combine réduction dimensionnelle par PCA et pondération de Zipf. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Évalué notamment sur des langues européennes et indiennes, il peut encoder des textes sur CPU ou GPU avec StaticModel.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 21 septembre 2024 |
| Dimension du vecteur | 256 |
| Représentation | dense statique à vecteur unique |
| Paramètres | 8 millions |
| Paramètres actifs | 8 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 25,1 % | 171ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 28,1 % | 133ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 24,2 % | 178ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 8,4 % | 93ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 20,7 % | 93ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 24,5 % | 128ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 31,2 % | 130ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 36,5 % | 117ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 1,3 % | 200ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 15,4 % | 143ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,7 % | 85ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Dutch | 29,7 % | 99ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Ses résultats relativement les plus favorables apparaissent sur MTEB European et MTEB Indic, ce qui le rend surtout intéressant pour expérimenter la recherche et la classification sémantiques dans plusieurs ensembles linguistiques. Ses 8 millions de paramètres et ses vecteurs de 256 dimensions favorisent un modèle compact, des index moins volumineux et un déploiement local sur CPU ou GPU. La licence MIT autorise l’auto-hébergement et une large réutilisation. Son calcul par moyenne d’embeddings statiques offre par ailleurs une procédure d’encodage simple.
Limites et points d'attention. Les classements restent bas sur l’ensemble des tracks fournis, y compris European et Indic. Les résultats sont encore plus faibles en recherche juridique, en néerlandais, sur Long-context Retrieval et surtout sur BEIR, ce qui limite son intérêt pour la recherche généraliste zero-shot, les corpus spécialisés et les documents demandant une représentation fine du contexte. La moyenne des tokens produit une représentation unique et statique, moins apte à préserver les relations complexes entre passages. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents et peut avoir quitté les catalogues actuels. Usages pertinents : prototypes légers, index compacts, clustering simple et recherche sémantique locale lorsque les performances de pointe ne sont pas prioritaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).