yibinlei/LENS-d8000

Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d8000 est un modèle d'embedding de 7 milliards de paramètres, tous actifs. Il produit des représentations lexicon-based de 8 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.

Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d8000 est un modèle d'embedding de 7 milliards de paramètres, tous actifs. Il produit des représentations lexicon-based de 8 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.

Distribué sous licence ouverte Apache 2.0, il transforme requêtes et documents en vecteurs destinés à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Son traitement associe un pooling max, une normalisation L2 et une comparaison par produit matriciel.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuryibinlei
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 janvier 2025
Dimension du vecteur8 000
Représentationlexicon-based (LENS), représentations de 8000 dimensions
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR61,9 %6ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. yibinlei/LENS-d8000 se distingue surtout en recherche d'information zero-shot. Sur BEIR, qui réunit des tâches et domaines hétérogènes, il se classe dans le top 10, ce qui indique une forte aptitude à rapprocher une requête de documents pertinents sans adaptation propre à chaque corpus. Son approche LENS rend les dimensions interprétables comme des groupes de tokens sémantiquement voisins. La licence Apache 2.0 facilite par ailleurs l'exploitation, l'adaptation et le déploiement dans des infrastructures maîtrisées.

Limites et points d'attention. Les vecteurs de 8 000 dimensions alourdissent les index et rendent leur stockage ainsi que les calculs de similarité plus coûteux que pour des embeddings plus compacts. Le modèle mobilise aussi ses 7 milliards de paramètres à chaque encodage, un facteur à intégrer dans les contraintes d'inférence. Sorti il y a environ un an, il appartient désormais à une génération ancienne à l'échelle de l'IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues actifs. Usages pertinents : recherche sémantique zero-shot, RAG, similarité documentaire et clustering lorsque la qualité de retrieval prime sur la compacité de l'index.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).