McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-supervised

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-supervised est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions.

Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Llama-2-7b-chat-hf-mntp-supervised est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions.

Le modèle sert à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering. Il convertit un LLM à décodeur seul en encodeur grâce à une attention bidirectionnelle, puis produit les représentations par pooling moyen. Sa licence MIT ouverte facilite l’auto-hébergement et l’intégration dans des applications.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMcGill-NLP
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie9 avril 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR54,6 %48ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

WhereIsAI/UAE-Large-V155 %
▶ McGill-NLP/LLM2Vec-Llam…55 %
manveertamber/cadet-emb…54 %

Notre analyse

Forces. Le modèle obtient un résultat solide sur BEIR, où il se situe dans le premier quart du classement indiqué. Ce benchmark évalue la recherche zero-shot sur des tâches et domaines variés, ce qui en fait un signal favorable pour le retrieval généraliste et la recherche de passages sans adaptation propre à chaque corpus. Les requêtes peuvent inclure des instructions, tandis que les documents sont encodés sans instruction. La similarité cosinus permet ensuite de comparer directement leurs représentations. Les poids finaux combinent le modèle de base, une adaptation LoRA par prédiction masquée du prochain token et une adaptation LoRA supervisée.

Limites et points d'attention. Son rang sur BEIR reste éloigné des toutes premières places. Les vecteurs de 4 096 dimensions alourdissent les index, la mémoire nécessaire et le coût des recherches par rapport à des représentations plus compactes. Les 7 milliards de paramètres actifs rendent aussi l’encodage plus exigeant que celui de petits modèles spécialisés. Avec environ deux ans d’ancienneté, une durée très longue à l’échelle de l’IA, il est probablement dépassé par des embeddings plus récents et peut avoir quitté certains catalogues. Usages pertinents : retrieval généraliste, RAG auto-hébergé, similarité sémantique et clustering sous licence MIT.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).