McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervised
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervised est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Distribué sous licence ouverte MIT, il peut être…
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervised est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des applications commerciales.
Le modèle convertit un LLM Mistral à décodeur seul en encodeur grâce à une attention bidirectionnelle. Il combine prédiction masquée du token suivant, apprentissage contrastif et adaptateurs LoRA. Ses représentations avec pooling moyen servent à la recherche sémantique, au RAG, au calcul de similarité cosinus et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | McGill-NLP |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 avril 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 56,0 % | 30ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,5 % | 103ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 34,4 % | 104ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 48,3 % | 47ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 36,5 % | 104ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 15,2 % | 147ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 21,5 % | 115ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 54,4 % | 40ᵉ / 117 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur positionnement relatif apparaît sur BEIR, ce qui indique une bonne aptitude à la recherche zero-shot dans des tâches et domaines hétérogènes. Les résultats en français et dans le domaine médical le placent également dans la partie supérieure de leurs classements respectifs, sans atteindre les toutes premières places. L’encodage de requêtes guidées par instruction, associé à celui de documents sans instruction, convient directement aux pipelines de retrieval. La licence MIT constitue un atout pratique pour l’auto-hébergement, la modification et l’exploitation commerciale.
Limites et points d’attention. Les performances sont nettement moins bien classées sur Legal, RTEB Legal et Long-context Retrieval. Le modèle paraît donc moins adapté à la recherche juridique spécialisée et aux tâches exigeant une récupération robuste dans de longs contenus. Ses vecteurs de 4 096 dimensions alourdissent les index et rendent le stockage ainsi que la recherche plus coûteux que des représentations plus compactes. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des embeddings plus récents. Usages pertinents : recherche sémantique généraliste, RAG, similarité et clustering, notamment en français ou sur des corpus médicaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).