McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-unsup-simcse

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres. Il produit des vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT, compatible avec l’auto-hébergement et…

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-unsup-simcse est un modèle d’embedding dense de 7 milliards de paramètres. Il produit des vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT, compatible avec l’auto-hébergement et l’intégration dans des applications.

Le modèle transforme un LLM à décodeur seul en encodeur grâce à une attention bidirectionnelle, à la prédiction masquée du prochain token et à l’apprentissage contrastif non supervisé SimCSE. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMcGill-NLP
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie9 avril 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR36,7 %151ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

Hum-Works/lodestone-bas…37 %
▶ McGill-NLP/LLM2Vec-Llam…37 %

Notre analyse

Forces. Le modèle associe les poids de base à un adaptateur LoRA MNTP et à un adaptateur LoRA SimCSE. Il peut encoder des requêtes accompagnées d’instructions, tandis que les documents sont encodés sans instruction. Le pooling moyen fournit une représentation dense exploitable avec la similarité cosinus. La licence MIT constitue un atout pratique pour le déploiement et l’adaptation. Son architecture de 7 milliards de paramètres offre une capacité de représentation substantielle pour construire des index sémantiques, rapprocher des contenus similaires ou regrouper des documents.

Limites et points d’attention. Sur BEIR, consacré à la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe dans le bas du classement, ce qui signale une qualité de retrieval limitée face aux autres modèles évalués. Les vecteurs de 4 096 dimensions alourdissent également le stockage des index et le coût des recherches par rapport à des représentations plus compactes. Sorti en avril 2024, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : expérimentation autour de LLM2Vec, indexation auto-hébergée sous licence MIT, similarité sémantique et clustering lorsque sa qualité sur les données ciblées a été validée.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).