infgrad/stella-base-zh-v3-1792d

Publié par infgrad le 17 février 2024 sous licence MIT, infgrad/stella-base-zh-v3-1792d est un modèle d’embedding de 104 millions de paramètres, tous actifs, conçu pour les textes généraux en chinois simplifié. Il accepte jusqu’à 512 tokens et produit des vecteurs denses de 1 792…

Publié par infgrad le 17 février 2024 sous licence MIT, infgrad/stella-base-zh-v3-1792d est un modèle d’embedding de 104 millions de paramètres, tous actifs, conçu pour les textes généraux en chinois simplifié. Il accepte jusqu’à 512 tokens et produit des vecteurs denses de 1 792 dimensions.

Le modèle encode les textes par mean pooling et s’intègre directement à SentenceTransformer. Ses représentations numériques servent notamment à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering de contenus chinois.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurinfgrad
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie17 février 2024
Dimension du vecteur1 792
Représentationdense
Paramètres104 millions
Paramètres actifs104 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chinese68,0 %26ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Son évaluation MTEB Chinese couvre la recherche, le reranking et la classification de paires, avec un résultat global qui le place dans la moitié supérieure des modèles évalués. L’entraînement applique un dropout 1D aux embeddings de tokens afin que chaque token puisse représenter la phrase entière, puis l’inférence agrège les représentations par mean pooling. La compatibilité directe avec SentenceTransformer simplifie son intégration dans une chaîne d’indexation. La licence MIT autorise l’auto-hébergement et des usages commerciaux avec peu de contraintes.

Limites et points d'attention. Sa 26e place sur 58 dans MTEB Chinese correspond à un positionnement intermédiaire plutôt qu’à une domination du classement. Les vecteurs de 1 792 dimensions alourdissent les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus compactes. La limite de 512 tokens impose aussi de découper les documents longs, tandis que sa spécialisation en chinois simplifié ne répond pas à un besoin multilingue. Sorti il y a environ deux ans, il appartient à une génération ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des corpus chinois simplifiés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).