thenlper/gte-small-zh
thenlper/gte-small-zh est un modèle d’embedding dense d’Alibaba, publié le 8 novembre 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 30 millions de paramètres actifs et produit un vecteur unique par texte. Sa dimension de sortie est référencée à 1 024.
thenlper/gte-small-zh est un modèle d’embedding dense d’Alibaba, publié le 8 novembre 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 30 millions de paramètres actifs et produit un vecteur unique par texte. Sa dimension de sortie est référencée à 1 024.
Spécialisé exclusivement dans le chinois, il accepte des séquences allant jusqu’à 512 tokens. Son entraînement contrastif multi-étapes repose sur des paires de textes pertinentes issues de domaines variés. Il sert à la recherche sémantique, au RAG, à la similarité, au reranking et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 8 novembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense (vecteur unique) |
| Paramètres | 30 millions |
| Paramètres actifs | 30 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Chinese | 60,0 % | 44ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Chinese
Notre analyse
Forces. Son entraînement sur des paires pertinentes cible directement le rapprochement sémantique de textes chinois. Il convient ainsi à la recherche d’information, à la similarité et au reranking, les familles de tâches couvertes par son évaluation MTEB Chinese. La représentation peut être extraite depuis le premier token de la dernière couche, avec une normalisation L2 facultative. Ses 30 millions de paramètres en font un modèle relativement compact à exécuter, tandis que la licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Son résultat MTEB Chinese le place dans le bas du classement évalué, ce qui indique une qualité globale probablement dépassée par une grande partie des modèles comparés. Sorti en 2023, il appartient à une génération ancienne à l’échelle de l’IA. Sa spécialisation exclusive au chinois exclut les corpus multilingues, et la limite de 512 tokens impose de segmenter les documents longs. La dimension de sortie référencée à 1 024 alourdit aussi les index et la recherche par rapport à des vecteurs plus compacts, alors que les caractéristiques techniques indiquent par ailleurs une dimension de 512, divergence à vérifier lors de l’intégration. Usages pertinents : recherche sémantique, RAG, similarité, reranking et clustering sur des textes chinois courts ou segmentés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).