McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-unsup-simcse

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-unsup-simcse est un modèle d’embedding dense de 1 milliard de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Sa licence MIT, ouverte et permissive, autorise notamment son…

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-unsup-simcse est un modèle d’embedding dense de 1 milliard de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Sa licence MIT, ouverte et permissive, autorise notamment son auto-hébergement et son intégration dans des applications.

Le modèle sert à indexer et rapprocher des contenus par similarité sémantique, notamment pour la recherche, la sélection de passages dans un système RAG et le clustering. Il compare les représentations par similarité cosinus et distingue les requêtes guidées par instruction des documents encodés sans instruction.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMcGill-NLP
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie9 avril 2024
Dimension du vecteur4 096
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR25,9 %169ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le modèle convertit un LLM à décodeur seul en encodeur grâce à une attention bidirectionnelle. Son entraînement associe la prédiction masquée du prochain token et l’apprentissage contrastif non supervisé SimCSE. Ses poids réunissent le modèle de base, un adaptateur LoRA MNTP et un adaptateur LoRA SimCSE, tandis que le pooling moyen fournit une représentation unique par texte. La licence MIT constitue un avantage pratique pour l’auto-hébergement, la modification et les usages commerciaux. La dimension de 4 096 peut aussi préserver une représentation dense riche pour la comparaison sémantique.

Limites et points d’attention. Sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe près du bas du classement, avec 26 % et le rang 169 sur 192. Cette faiblesse limite son intérêt lorsque la qualité de retrieval généraliste constitue le critère principal. Les vecteurs de 4 096 dimensions alourdissent également les index, la mémoire occupée et le calcul de similarité. Sorti il y a environ deux ans, une ancienneté très longue à l’échelle de l’IA, il est probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : expérimentation autour de LLM2Vec, recherche sémantique, RAG ou clustering auto-hébergés sous licence MIT, après validation sur les données ciblées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).