yibinlei/LENS-d8000
Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d8000 est un modèle d'embedding de 7 milliards de paramètres, tous actifs. Il produit des représentations lexicon-based de 8 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.
Publié par yibinlei le 17 janvier 2025, yibinlei/LENS-d8000 est un modèle d'embedding de 7 milliards de paramètres, tous actifs. Il produit des représentations lexicon-based de 8 000 dimensions, chaque dimension correspondant à un cluster de tokens sémantiquement similaires.
Distribué sous licence ouverte Apache 2.0, il transforme requêtes et documents en vecteurs destinés à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Son traitement associe un pooling max, une normalisation L2 et une comparaison par produit matriciel.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | yibinlei |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 janvier 2025 |
| Dimension du vecteur | 8 000 |
| Représentation | lexicon-based (LENS), représentations de 8000 dimensions |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 61,9 % | 6ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. yibinlei/LENS-d8000 se distingue surtout en recherche d'information zero-shot. Sur BEIR, qui réunit des tâches et domaines hétérogènes, il se classe dans le top 10, ce qui indique une forte aptitude à rapprocher une requête de documents pertinents sans adaptation propre à chaque corpus. Son approche LENS rend les dimensions interprétables comme des groupes de tokens sémantiquement voisins. La licence Apache 2.0 facilite par ailleurs l'exploitation, l'adaptation et le déploiement dans des infrastructures maîtrisées.
Limites et points d'attention. Les vecteurs de 8 000 dimensions alourdissent les index et rendent leur stockage ainsi que les calculs de similarité plus coûteux que pour des embeddings plus compacts. Le modèle mobilise aussi ses 7 milliards de paramètres à chaque encodage, un facteur à intégrer dans les contraintes d'inférence. Sorti il y a environ un an, il appartient désormais à une génération ancienne à l'échelle de l'IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues actifs. Usages pertinents : recherche sémantique zero-shot, RAG, similarité documentaire et clustering lorsque la qualité de retrieval prime sur la compacité de l'index.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).