McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-unsup-simcse
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-unsup-simcse est un modèle d’embedding dense de 1 milliard de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Sa licence MIT, ouverte et permissive, autorise notamment son…
Publié par McGill-NLP le 9 avril 2024, McGill-NLP/LLM2Vec-Sheared-LLaMA-mntp-unsup-simcse est un modèle d’embedding dense de 1 milliard de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions. Sa licence MIT, ouverte et permissive, autorise notamment son auto-hébergement et son intégration dans des applications.
Le modèle sert à indexer et rapprocher des contenus par similarité sémantique, notamment pour la recherche, la sélection de passages dans un système RAG et le clustering. Il compare les représentations par similarité cosinus et distingue les requêtes guidées par instruction des documents encodés sans instruction.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | McGill-NLP |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 avril 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 25,9 % | 169ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Le modèle convertit un LLM à décodeur seul en encodeur grâce à une attention bidirectionnelle. Son entraînement associe la prédiction masquée du prochain token et l’apprentissage contrastif non supervisé SimCSE. Ses poids réunissent le modèle de base, un adaptateur LoRA MNTP et un adaptateur LoRA SimCSE, tandis que le pooling moyen fournit une représentation unique par texte. La licence MIT constitue un avantage pratique pour l’auto-hébergement, la modification et les usages commerciaux. La dimension de 4 096 peut aussi préserver une représentation dense riche pour la comparaison sémantique.
Limites et points d’attention. Sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe près du bas du classement, avec 26 % et le rang 169 sur 192. Cette faiblesse limite son intérêt lorsque la qualité de retrieval généraliste constitue le critère principal. Les vecteurs de 4 096 dimensions alourdissent également les index, la mémoire occupée et le calcul de similarité. Sorti il y a environ deux ans, une ancienneté très longue à l’échelle de l’IA, il est probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : expérimentation autour de LLM2Vec, recherche sémantique, RAG ou clustering auto-hébergés sous licence MIT, après validation sur les données ciblées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).