McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcse
Publié par McGill-NLP le 9 avril 2024 sous licence ouverte MIT, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres actifs. Il transforme les textes en vecteurs de 4 096 dimensions.
Publié par McGill-NLP le 9 avril 2024 sous licence ouverte MIT, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres actifs. Il transforme les textes en vecteurs de 4 096 dimensions.
Issu de Mistral-7B-Instruct-v2, ce modèle décodeur seul est converti en encodeur par une attention bidirectionnelle, la prédiction masquée du prochain token et un apprentissage contrastif non supervisé SimCSE. Le pooling moyen produit des représentations destinées à la recherche sémantique, au RAG, au calcul de similarité cosinus et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | McGill-NLP |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 avril 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 38,1 % | 147ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 29,8 % | 126ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 24,6 % | 176ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 34,2 % | 102ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 27,0 % | 138ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 3,5 % | 184ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 14,6 % | 148ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 43,7 % | 90ᵉ / 117 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB sont relativement plus favorables sur le français et sur BEIR, ce qui en fait surtout un candidat pour l’encodage de textes français et la recherche zero-shot sur des tâches et domaines hétérogènes. Le modèle accepte des requêtes assorties d’instructions et des documents sans instruction, une organisation adaptée aux pipelines de retrieval. Ses poids associent le modèle de base à des adaptateurs LoRA MNTP et SimCSE. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d’attention. Les classements restent modestes sur tous les tracks fournis, avec des positions particulièrement faibles en Long-context Retrieval et dans les évaluations juridiques Legal et RTEB Legal. Le médical demeure également en retrait. Les vecteurs de 4 096 dimensions alourdissent les index et rendent le stockage ainsi que la recherche plus coûteux que des représentations plus compactes. Avec 7 milliards de paramètres actifs, l’encodage exige aussi une infrastructure conséquente. Sorti il y a près de deux ans, un âge très long à l’échelle de l’IA, le modèle est probablement dépassé par des embeddings plus récents et peut avoir quitté les catalogues courants. Usages pertinents : prototypes auto-hébergés de recherche sémantique, RAG, similarité et clustering, notamment sur des corpus français.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).