minishlab/M2V_base_glove_subword

Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_glove_subword est un modèle d’embedding dense statique de 103 millions de paramètres. Il produit des vecteurs de 256 dimensions, un format relativement compact pour constituer et interroger un index…

Publié par minishlab le 21 septembre 2024 sous licence ouverte MIT, minishlab/M2V_base_glove_subword est un modèle d’embedding dense statique de 103 millions de paramètres. Il produit des vecteurs de 256 dimensions, un format relativement compact pour constituer et interroger un index sémantique.

Distillé de BAAI/bge-base-en-v1.5, ce modèle Model2Vec repose sur des embeddings réduits par PCA puis pondérés selon une loi de Zipf. À l’inférence, il calcule sur CPU ou GPU la moyenne des embeddings des tokens. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie21 septembre 2024
Dimension du vecteur256
Représentationdense statique
Paramètres103 millions
Paramètres actifs103 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR26,2 %167ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval28,4 %132ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal24,2 %177ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare9,0 %91ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance20,8 %92ᵉ / 97mteb✅ Mesuré
MTEB: Medical26,1 %125ᵉ / 158mteb✅ Mesuré
MTEB: Legal31,0 %131ᵉ / 157mteb✅ Mesuré
MTEB: European37,1 %115ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French1,7 %197ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German15,4 %145ᵉ / 209mteb✅ Mesuré
MTEB: Indic33,0 %82ᵉ / 119mteb✅ Mesuré
MTEB: Dutch30,6 %97ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ minishlab/M2V_base_glov…26 %

MTEB: Long-context Retrieval

bigscience/sgpt-bloom-7…29 %
▶ minishlab/M2V_base_glov…28 %

Notre analyse

Forces. Les évaluations MTEB European et MTEB Indic constituent ses résultats relatifs les plus favorables, ce qui met surtout en avant le traitement de textes dans plusieurs langues pour la classification et le bitext mining. Sa représentation statique simplifie le calcul à l’inférence, fondé sur une moyenne des embeddings de tokens. Les vecteurs de 256 dimensions limitent la taille des index et le coût de leur interrogation par rapport à des représentations plus larges. La licence MIT autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Malgré leurs scores relativement supérieurs, les tracks European et Indic restent associés à des rangs bas. Les résultats sont également faibles sur MTEB Legal et Dutch, sur Long-context Retrieval et, plus encore, sur BEIR pour la recherche zero-shot dans des domaines hétérogènes. La moyenne statique des tokens privilégie la simplicité, mais restitue moins finement l’ordre et le contexte qu’une représentation contextualisée. Sorti en 2024, le modèle appartient désormais à une génération ancienne à l’échelle de l’IA et apparaît probablement dépassé face à des embeddings plus récents. Les usages pertinents sont les index compacts, les prototypes de recherche sémantique et le clustering lorsque la légèreté prime sur la qualité maximale.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).