McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervised

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervised est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Distribué sous licence ouverte MIT, il peut être…

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervised est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des applications commerciales.

Le modèle convertit un LLM Mistral à décodeur seul en encodeur grâce à une attention bidirectionnelle. Il combine prédiction masquée du token suivant, apprentissage contrastif et adaptateurs LoRA. Ses représentations avec pooling moyen servent à la recherche sémantique, au RAG, au calcul de similarité cosinus et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMcGill-NLP
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie9 avril 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR56,0 %30ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval34,5 %103ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal34,4 %104ᵉ / 208mteb✅ Mesuré
MTEB: Medical48,3 %47ᵉ / 158mteb✅ Mesuré
MTEB: Legal36,5 %104ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French15,2 %147ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German21,5 %115ᵉ / 209mteb✅ Mesuré
MTEB: French54,4 %40ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur positionnement relatif apparaît sur BEIR, ce qui indique une bonne aptitude à la recherche zero-shot dans des tâches et domaines hétérogènes. Les résultats en français et dans le domaine médical le placent également dans la partie supérieure de leurs classements respectifs, sans atteindre les toutes premières places. L’encodage de requêtes guidées par instruction, associé à celui de documents sans instruction, convient directement aux pipelines de retrieval. La licence MIT constitue un atout pratique pour l’auto-hébergement, la modification et l’exploitation commerciale.

Limites et points d’attention. Les performances sont nettement moins bien classées sur Legal, RTEB Legal et Long-context Retrieval. Le modèle paraît donc moins adapté à la recherche juridique spécialisée et aux tâches exigeant une récupération robuste dans de longs contenus. Ses vecteurs de 4 096 dimensions alourdissent les index et rendent le stockage ainsi que la recherche plus coûteux que des représentations plus compactes. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des embeddings plus récents. Usages pertinents : recherche sémantique généraliste, RAG, similarité et clustering, notamment en français ou sur des corpus médicaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).