minishlab/M2V_multilingual_output
Publié par minishlab le 21 septembre 2024, minishlab/M2V_multilingual_output est un modèle d’embedding multilingue sous licence ouverte MIT. Ses 128 millions de paramètres, tous actifs, produisent des vecteurs denses statiques de 256 dimensions.
Publié par minishlab le 21 septembre 2024, minishlab/M2V_multilingual_output est un modèle d’embedding multilingue sous licence ouverte MIT. Ses 128 millions de paramètres, tous actifs, produisent des vecteurs denses statiques de 256 dimensions.
Cette version distillée de sentence-transformers/LaBSE transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Le vocabulaire est projeté par le modèle d’origine, puis réduit par PCA et pondéré selon Zipf. À l’inférence, chaque phrase correspond à la moyenne des embeddings de ses tokens.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 21 septembre 2024 |
| Dimension du vecteur | 256 |
| Représentation | dense statique |
| Paramètres | 128 millions |
| Paramètres actifs | 128 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 21,9 % | 184ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 7,2 % | 94ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 14,0 % | 96ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 6,7 % | 169ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 11,2 % | 170ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Legal
MTEB: RTEB Finance
Notre analyse
Forces. Le meilleur résultat relatif du modèle sur les tracks fournis concerne RTEB Legal, ce qui en fait son domaine le moins faible pour la recherche parmi des décisions, des textes législatifs et des résumés juridiques. Son approche multilingue couvre notamment les évaluations en français et en allemand. Les vecteurs de 256 dimensions permettent de constituer des index plus compacts que ceux reposant sur des représentations de plus grande dimension. La licence MIT facilite l’intégration, la modification et l’auto-hébergement. Le modèle se charge avec StaticModel.from_pretrained et encode directement les textes via encode.
Limites et points d'attention. Les classements RTEB placent le modèle dans la partie basse des évaluations juridiques, allemandes et françaises, et presque en dernière position en finance et en santé. Les résultats indiquent donc une qualité de récupération limitée dans les corpus spécialisés, particulièrement pour les contenus médicaux, les questions-réponses financières et les tâches francophones. Sa représentation statique, fondée sur la moyenne des tokens, privilégie une architecture simple plutôt qu’une modélisation contextuelle dynamique. Sorti il y a près de deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Les usages pertinents sont les index multilingues compacts, le prototypage de recherche sémantique et le clustering lorsque la licence ouverte prime sur les performances de pointe.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).