minishlab/M2V_multilingual_output

Publié par minishlab le 21 septembre 2024, minishlab/M2V_multilingual_output est un modèle d’embedding multilingue sous licence ouverte MIT. Ses 128 millions de paramètres, tous actifs, produisent des vecteurs denses statiques de 256 dimensions.

Publié par minishlab le 21 septembre 2024, minishlab/M2V_multilingual_output est un modèle d’embedding multilingue sous licence ouverte MIT. Ses 128 millions de paramètres, tous actifs, produisent des vecteurs denses statiques de 256 dimensions.

Cette version distillée de sentence-transformers/LaBSE transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Le vocabulaire est projeté par le modèle d’origine, puis réduit par PCA et pondéré selon Zipf. À l’inférence, chaque phrase correspond à la moyenne des embeddings de ses tokens.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie21 septembre 2024
Dimension du vecteur256
Représentationdense statique
Paramètres128 millions
Paramètres actifs128 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal21,9 %184ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare7,2 %94ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance14,0 %96ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French6,7 %169ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German11,2 %170ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Legal

consciousAI/cai-lunaris…22 %
▶ minishlab/M2V_multiling…22 %

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ minishlab/M2V_multiling…14 %

Notre analyse

Forces. Le meilleur résultat relatif du modèle sur les tracks fournis concerne RTEB Legal, ce qui en fait son domaine le moins faible pour la recherche parmi des décisions, des textes législatifs et des résumés juridiques. Son approche multilingue couvre notamment les évaluations en français et en allemand. Les vecteurs de 256 dimensions permettent de constituer des index plus compacts que ceux reposant sur des représentations de plus grande dimension. La licence MIT facilite l’intégration, la modification et l’auto-hébergement. Le modèle se charge avec StaticModel.from_pretrained et encode directement les textes via encode.

Limites et points d'attention. Les classements RTEB placent le modèle dans la partie basse des évaluations juridiques, allemandes et françaises, et presque en dernière position en finance et en santé. Les résultats indiquent donc une qualité de récupération limitée dans les corpus spécialisés, particulièrement pour les contenus médicaux, les questions-réponses financières et les tâches francophones. Sa représentation statique, fondée sur la moyenne des tokens, privilégie une architecture simple plutôt qu’une modélisation contextuelle dynamique. Sorti il y a près de deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Les usages pertinents sont les index multilingues compacts, le prototypage de recherche sémantique et le clustering lorsque la licence ouverte prime sur les performances de pointe.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).