McGill-NLP/LLM2Vec-Meta-Llama-3-8B-Instruct-mntp-unsup-simcse
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Meta-Llama-3-8B-Instruct-mntp-unsup-simcse est un modèle d’embedding dense de 8 milliards de paramètres. Il transforme les textes en vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT.
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Meta-Llama-3-8B-Instruct-mntp-unsup-simcse est un modèle d’embedding dense de 8 milliards de paramètres. Il transforme les textes en vecteurs de 4 096 dimensions et repose sur une licence ouverte MIT.
LLM2Vec convertit un LLM à décodeur seul en encodeur grâce à l’attention bidirectionnelle, à la prédiction masquée du prochain token et à l’apprentissage contrastif non supervisé. Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | McGill-NLP |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 avril 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 39,2 % | 143ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Le modèle combine des poids LoRA issus de l’entraînement MNTP et de SimCSE non supervisé, puis produit une représentation dense par pooling moyen. Il accepte des requêtes assorties d’instructions et des documents sans instruction, une organisation adaptée à la mise en correspondance de requêtes et de passages. La similarité cosinus permet de classer les résultats, de rapprocher des contenus ou de constituer des groupes thématiques. La licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.
Limites et points d’attention. Sur BEIR, qui mesure la qualité de recherche zero-shot dans des tâches et domaines hétérogènes, son classement se situe dans la partie basse des modèles évalués. Ses vecteurs de 4 096 dimensions rendent aussi les index plus volumineux et les calculs de similarité plus coûteux que ceux d’embeddings plus compacts. Avec 8 milliards de paramètres actifs, son déploiement est relativement lourd. Sorti il y a environ deux ans, il appartient à une génération ancienne à l’échelle de l’IA et est probablement dépassé par des offres plus récentes. Usages pertinents : expérimentation autour de LLM2Vec, recherche sémantique, RAG, similarité et clustering sous licence MIT.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).