McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-supervised

Publié le 9 avril 2024 par McGill-NLP sous licence ouverte MIT, McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-supervised est un modèle d’embedding dense de 1 milliard de paramètres actifs. Il transforme chaque texte en un vecteur unique de 4 096 dimensions obtenu par pooling moyen.

Publié le 9 avril 2024 par McGill-NLP sous licence ouverte MIT, McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-supervised est un modèle d’embedding dense de 1 milliard de paramètres actifs. Il transforme chaque texte en un vecteur unique de 4 096 dimensions obtenu par pooling moyen.

Le modèle sert à la recherche sémantique, à la sélection de documents pour le RAG, au calcul de similarité cosinus et au clustering. Il convertit un Sheared-LLaMA à décodeur seul en encodeur grâce à l’attention bidirectionnelle, à la prédiction masquée du prochain token et à l’apprentissage contrastif non supervisé.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMcGill-NLP
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie9 avril 2024
Dimension du vecteur4 096
Représentationdense à vecteur unique avec pooling moyen
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,4 %83ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le modèle est directement orienté vers le retrieval, avec un résultat BEIR qui le place dans la partie médiane du classement évalué. Il accepte des requêtes assorties d’instructions et des documents sans instruction, une organisation adaptée à l’appariement entre questions et passages. Ses poids réunissent le modèle de base, des adaptateurs LoRA MNTP et des adaptateurs LoRA supervisés. La licence MIT autorise l’auto-hébergement et une réutilisation large.

Limites et points d’attention. Son rang 83 sur 192 sur BEIR ne le situe pas parmi les références de tête en recherche zero-shot sur des tâches et domaines hétérogènes. Les vecteurs denses de 4 096 dimensions alourdissent les index, la mémoire nécessaire et le coût des recherches de similarité par rapport à des représentations moins dimensionnées. Sorti il y a environ deux ans, il appartient à une génération désormais très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues. Usages pertinents : recherche sémantique, RAG, similarité cosinus et clustering dans un déploiement maîtrisé sous licence MIT.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).