infgrad/stella-base-zh-v3-1792d
Publié par infgrad le 17 février 2024 sous licence MIT, infgrad/stella-base-zh-v3-1792d est un modèle d’embedding de 104 millions de paramètres, tous actifs, conçu pour les textes généraux en chinois simplifié. Il accepte jusqu’à 512 tokens et produit des vecteurs denses de 1 792…
Publié par infgrad le 17 février 2024 sous licence MIT, infgrad/stella-base-zh-v3-1792d est un modèle d’embedding de 104 millions de paramètres, tous actifs, conçu pour les textes généraux en chinois simplifié. Il accepte jusqu’à 512 tokens et produit des vecteurs denses de 1 792 dimensions.
Le modèle encode les textes par mean pooling et s’intègre directement à SentenceTransformer. Ses représentations numériques servent notamment à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering de contenus chinois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | infgrad |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 17 février 2024 |
| Dimension du vecteur | 1 792 |
| Représentation | dense |
| Paramètres | 104 millions |
| Paramètres actifs | 104 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Chinese | 68,0 % | 26ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Chinese
Notre analyse
Forces. Son évaluation MTEB Chinese couvre la recherche, le reranking et la classification de paires, avec un résultat global qui le place dans la moitié supérieure des modèles évalués. L’entraînement applique un dropout 1D aux embeddings de tokens afin que chaque token puisse représenter la phrase entière, puis l’inférence agrège les représentations par mean pooling. La compatibilité directe avec SentenceTransformer simplifie son intégration dans une chaîne d’indexation. La licence MIT autorise l’auto-hébergement et des usages commerciaux avec peu de contraintes.
Limites et points d'attention. Sa 26e place sur 58 dans MTEB Chinese correspond à un positionnement intermédiaire plutôt qu’à une domination du classement. Les vecteurs de 1 792 dimensions alourdissent les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus compactes. La limite de 512 tokens impose aussi de découper les documents longs, tandis que sa spécialisation en chinois simplifié ne répond pas à un besoin multilingue. Sorti il y a environ deux ans, il appartient à une génération ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des corpus chinois simplifiés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).