thenlper/gte-large-zh

thenlper/gte-large-zh est un modèle d’embedding dense publié par Alibaba le 8 novembre 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 326 millions de paramètres, tous actifs, et transforme exclusivement des textes chinois en vecteurs de 1 024 dimensions. Sa…

thenlper/gte-large-zh est un modèle d’embedding dense publié par Alibaba le 8 novembre 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 326 millions de paramètres, tous actifs, et transforme exclusivement des textes chinois en vecteurs de 1 024 dimensions. Sa longueur maximale est de 512 jetons.

Entraîné par apprentissage contrastif multi-étapes sur des paires de textes issues de domaines variés, il extrait la représentation du premier jeton de la dernière couche cachée, avec normalisation L2 optionnelle. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la similarité, au reranking et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie8 novembre 2023
Dimension du vecteur1 024
Représentationdense
Paramètres326 millions
Paramètres actifs326 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chinese66,7 %33ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Chinese

malenia1/ternary-weight…67 %
▶ thenlper/gte-large-zh67 %
DMetaSoul/Dmeta-embeddi…66 %

Notre analyse

Forces. Son évaluation MTEB: Chinese couvre la recherche d’information, le reranking et la classification de paires, ce qui confirme une orientation vers plusieurs tâches de rapprochement sémantique en chinois. L’apprentissage contrastif multi-étapes sur un vaste corpus de paires pertinentes vise à rapprocher les contenus liés et à séparer les textes moins similaires. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration commerciale. La normalisation L2 optionnelle permet aussi de préparer directement les vecteurs à des comparaisons de similarité.

Limites et points d’attention. Son résultat MTEB: Chinese le place dans la seconde moitié du classement, loin d’une position dominante parmi les modèles évalués. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings chinois plus récents, les modèles de cette période étant aussi souvent retirés des catalogues des éditeurs. Sa couverture strictement chinoise exclut les corpus multilingues. La limite de 512 jetons impose de découper les documents longs. Les vecteurs de 1 024 dimensions alourdissent l’index et rendent la recherche plus coûteuse que des représentations plus compactes. Usages pertinents : recherche sémantique, RAG, similarité, reranking et clustering sur des corpus chinois correctement segmentés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).