yibinlei/LENS-d4000

Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d4000 est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Il produit une représentation lexicale de 4 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.

Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d4000 est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Il produit une représentation lexicale de 4 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.

Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes de recherche sémantique, de RAG, de comparaison de textes ou de clustering. Pour la recherche de passages, son fonctionnement associe une instruction appliquée aux requêtes, un max-pooling, une normalisation L2 et un calcul de similarité par produit matriciel.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuryibinlei
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 janvier 2025
Dimension du vecteur4 000
Représentationlexicale fondée sur des clusters de tokens, sous forme d’un vecteur de 4 000 dimensions
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR60,8 %9ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. LENS-d4000 se distingue principalement en recherche d’information zero-shot. Son résultat sur BEIR le place dans le top 10 parmi 192 modèles évalués sur des tâches et des domaines hétérogènes, ce qui indique une forte aptitude à retrouver des passages pertinents sans adaptation spécifique à chaque corpus. La représentation par clusters de tokens apporte une structure lexicale interprétable au vecteur, tandis que la normalisation L2 et le produit matriciel facilitent l’intégration dans une chaîne de retrieval. La licence Apache 2.0 autorise en outre le déploiement et l’adaptation dans des infrastructures auto-hébergées.

Limites et points d’attention. Avec 7 milliards de paramètres actifs, le calcul des embeddings exige davantage de ressources qu’un encodeur plus petit. Les vecteurs de 4 000 dimensions alourdissent également le stockage des index et augmentent le coût des opérations de similarité à grande échelle. Sorti il y a environ un an, soit une ancienneté importante dans le cycle rapide de l’IA, le modèle peut être dépassé par des embeddings plus récents et avoir disparu des sélections courantes de son éditeur. Usages pertinents : recherche de passages, RAG, similarité documentaire et clustering lorsque la qualité de retrieval et l’auto-hébergement priment sur la compacité.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).