yibinlei/LENS-d4000
Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d4000 est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Il produit une représentation lexicale de 4 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.
Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d4000 est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Il produit une représentation lexicale de 4 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.
Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes de recherche sémantique, de RAG, de comparaison de textes ou de clustering. Pour la recherche de passages, son fonctionnement associe une instruction appliquée aux requêtes, un max-pooling, une normalisation L2 et un calcul de similarité par produit matriciel.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | yibinlei |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 janvier 2025 |
| Dimension du vecteur | 4 000 |
| Représentation | lexicale fondée sur des clusters de tokens, sous forme d’un vecteur de 4 000 dimensions |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 60,8 % | 9ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. LENS-d4000 se distingue principalement en recherche d’information zero-shot. Son résultat sur BEIR le place dans le top 10 parmi 192 modèles évalués sur des tâches et des domaines hétérogènes, ce qui indique une forte aptitude à retrouver des passages pertinents sans adaptation spécifique à chaque corpus. La représentation par clusters de tokens apporte une structure lexicale interprétable au vecteur, tandis que la normalisation L2 et le produit matriciel facilitent l’intégration dans une chaîne de retrieval. La licence Apache 2.0 autorise en outre le déploiement et l’adaptation dans des infrastructures auto-hébergées.
Limites et points d’attention. Avec 7 milliards de paramètres actifs, le calcul des embeddings exige davantage de ressources qu’un encodeur plus petit. Les vecteurs de 4 000 dimensions alourdissent également le stockage des index et augmentent le coût des opérations de similarité à grande échelle. Sorti il y a environ un an, soit une ancienneté importante dans le cycle rapide de l’IA, le modèle peut être dépassé par des embeddings plus récents et avoir disparu des sélections courantes de son éditeur. Usages pertinents : recherche de passages, RAG, similarité documentaire et clustering lorsque la qualité de retrieval et l’auto-hébergement priment sur la compacité.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).