McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-unsup-simcse
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres. Il produit des vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT, compatible avec l’auto-hébergement et…
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres. Il produit des vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT, compatible avec l’auto-hébergement et l’intégration dans des applications.
Le modèle transforme un LLM à décodeur seul en encodeur grâce à une attention bidirectionnelle, à la prédiction masquée du prochain token et à l’apprentissage contrastif non supervisé SimCSE. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | McGill-NLP |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 avril 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 36,7 % | 151ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Le modèle associe les poids de base à un adaptateur LoRA MNTP et à un adaptateur LoRA SimCSE. Il peut encoder des requêtes accompagnées d’instructions, tandis que les documents sont encodés sans instruction. Le pooling moyen fournit une représentation dense exploitable avec la similarité cosinus. La licence MIT constitue un atout pratique pour le déploiement et l’adaptation. Son architecture de 7 milliards de paramètres offre une capacité de représentation substantielle pour construire des index sémantiques, rapprocher des contenus similaires ou regrouper des documents.
Limites et points d’attention. Sur BEIR, consacré à la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe dans le bas du classement, ce qui signale une qualité de retrieval limitée face aux autres modèles évalués. Les vecteurs de 4 096 dimensions alourdissent également le stockage des index et le coût des recherches par rapport à des représentations plus compactes. Sorti en avril 2024, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : expérimentation autour de LLM2Vec, indexation auto-hébergée sous licence MIT, similarité sémantique et clustering lorsque sa qualité sur les données ciblées a été validée.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).