McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcse

Publié par McGill-NLP le 9 avril 2024 sous licence ouverte MIT, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres actifs. Il transforme les textes en vecteurs de 4 096 dimensions.

Publié par McGill-NLP le 9 avril 2024 sous licence ouverte MIT, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres actifs. Il transforme les textes en vecteurs de 4 096 dimensions.

Issu de Mistral-7B-Instruct-v2, ce modèle décodeur seul est converti en encodeur par une attention bidirectionnelle, la prédiction masquée du prochain token et un apprentissage contrastif non supervisé SimCSE. Le pooling moyen produit des représentations destinées à la recherche sémantique, au RAG, au calcul de similarité cosinus et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMcGill-NLP
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie9 avril 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR38,1 %147ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval29,8 %126ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal24,6 %176ᵉ / 208mteb✅ Mesuré
MTEB: Medical34,2 %102ᵉ / 158mteb✅ Mesuré
MTEB: Legal27,0 %138ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French3,5 %184ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German14,6 %148ᵉ / 209mteb✅ Mesuré
MTEB: French43,7 %90ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

deepfile/embedder-100p39 %
▶ McGill-NLP/LLM2Vec-Mist…38 %
Hum-Works/lodestone-bas…37 %

MTEB: Long-context Retrieval

consciousAI/cai-lunaris…30 %
▶ McGill-NLP/LLM2Vec-Mist…30 %
brahmairesearch/slx-v0.130 %

Notre analyse

Forces. Les résultats MTEB sont relativement plus favorables sur le français et sur BEIR, ce qui en fait surtout un candidat pour l’encodage de textes français et la recherche zero-shot sur des tâches et domaines hétérogènes. Le modèle accepte des requêtes assorties d’instructions et des documents sans instruction, une organisation adaptée aux pipelines de retrieval. Ses poids associent le modèle de base à des adaptateurs LoRA MNTP et SimCSE. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Les classements restent modestes sur tous les tracks fournis, avec des positions particulièrement faibles en Long-context Retrieval et dans les évaluations juridiques Legal et RTEB Legal. Le médical demeure également en retrait. Les vecteurs de 4 096 dimensions alourdissent les index et rendent le stockage ainsi que la recherche plus coûteux que des représentations plus compactes. Avec 7 milliards de paramètres actifs, l’encodage exige aussi une infrastructure conséquente. Sorti il y a près de deux ans, un âge très long à l’échelle de l’IA, le modèle est probablement dépassé par des embeddings plus récents et peut avoir quitté les catalogues courants. Usages pertinents : prototypes auto-hébergés de recherche sémantique, RAG, similarité et clustering, notamment sur des corpus français.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).