minishlab/M2V_base_output

Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_output est un modèle d’embedding de 8 millions de paramètres. Il produit un unique vecteur dense statique de 256 dimensions par texte, obtenu en moyennant les embeddings des tokens.

Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_output est un modèle d’embedding de 8 millions de paramètres. Il produit un unique vecteur dense statique de 256 dimensions par texte, obtenu en moyennant les embeddings des tokens.

Distillé de baai/bge-base-en-v1.5, il combine réduction dimensionnelle par PCA et pondération de Zipf. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Évalué notamment sur des langues européennes et indiennes, il peut encoder des textes sur CPU ou GPU avec StaticModel.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie21 septembre 2024
Dimension du vecteur256
Représentationdense statique à vecteur unique
Paramètres8 millions
Paramètres actifs8 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR25,1 %171ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval28,1 %133ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal24,2 %178ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare8,4 %93ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance20,7 %93ᵉ / 97mteb✅ Mesuré
MTEB: Medical24,5 %128ᵉ / 158mteb✅ Mesuré
MTEB: Legal31,2 %130ᵉ / 157mteb✅ Mesuré
MTEB: European36,5 %117ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French1,3 %200ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German15,4 %143ᵉ / 209mteb✅ Mesuré
MTEB: Indic32,7 %85ᵉ / 119mteb✅ Mesuré
MTEB: Dutch29,7 %99ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ minishlab/M2V_base_outp…25 %

MTEB: Long-context Retrieval

bigscience/sgpt-bloom-7…29 %
▶ minishlab/M2V_base_outp…28 %

Notre analyse

Forces. Ses résultats relativement les plus favorables apparaissent sur MTEB European et MTEB Indic, ce qui le rend surtout intéressant pour expérimenter la recherche et la classification sémantiques dans plusieurs ensembles linguistiques. Ses 8 millions de paramètres et ses vecteurs de 256 dimensions favorisent un modèle compact, des index moins volumineux et un déploiement local sur CPU ou GPU. La licence MIT autorise l’auto-hébergement et une large réutilisation. Son calcul par moyenne d’embeddings statiques offre par ailleurs une procédure d’encodage simple.

Limites et points d'attention. Les classements restent bas sur l’ensemble des tracks fournis, y compris European et Indic. Les résultats sont encore plus faibles en recherche juridique, en néerlandais, sur Long-context Retrieval et surtout sur BEIR, ce qui limite son intérêt pour la recherche généraliste zero-shot, les corpus spécialisés et les documents demandant une représentation fine du contexte. La moyenne des tokens produit une représentation unique et statique, moins apte à préserver les relations complexes entre passages. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents et peut avoir quitté les catalogues actuels. Usages pertinents : prototypes légers, index compacts, clustering simple et recherche sémantique locale lorsque les performances de pointe ne sont pas prioritaires.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).