McGill-NLP/LLM2Vec-Meta-Llama-3-8B-Instruct-mntp-unsup-simcse

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Meta-Llama-3-8B-Instruct-mntp-unsup-simcse est un modèle d’embedding dense de 8 milliards de paramètres. Il transforme les textes en vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT.

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Meta-Llama-3-8B-Instruct-mntp-unsup-simcse est un modèle d’embedding dense de 8 milliards de paramètres. Il transforme les textes en vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT.

LLM2Vec convertit un LLM à décodeur seul en encodeur grâce à l’attention bidirectionnelle, à la prédiction masquée du prochain token et à l’apprentissage contrastif non supervisé. Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMcGill-NLP
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie9 avril 2024
Dimension du vecteur4 096
Représentationdense
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR39,2 %143ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ McGill-NLP/LLM2Vec-Meta…39 %
deepfile/embedder-100p39 %

Notre analyse

Forces. Le modèle combine des poids LoRA issus de l’entraînement MNTP et de SimCSE non supervisé, puis produit une représentation dense par pooling moyen. Il accepte des requêtes assorties d’instructions et des documents sans instruction, une organisation adaptée à la mise en correspondance de requêtes et de passages. La similarité cosinus permet de classer les résultats, de rapprocher des contenus ou de constituer des groupes thématiques. La licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.

Limites et points d’attention. Sur BEIR, qui mesure la qualité de recherche zero-shot dans des tâches et domaines hétérogènes, son classement se situe dans la partie basse des modèles évalués. Ses vecteurs de 4 096 dimensions rendent aussi les index plus volumineux et les calculs de similarité plus coûteux que ceux d’embeddings plus compacts. Avec 8 milliards de paramètres actifs, son déploiement est relativement lourd. Sorti il y a environ deux ans, il appartient à une génération ancienne à l’échelle de l’IA et est probablement dépassé par des offres plus récentes. Usages pertinents : expérimentation autour de LLM2Vec, recherche sémantique, RAG, similarité et clustering sous licence MIT.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).