thenlper/gte-base-zh
thenlper/gte-base-zh est un modèle d'embedding d'Alibaba, publié le 8 novembre 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 102 millions de paramètres, tous actifs, et produit pour chaque texte chinois un vecteur dense de 1 024 dimensions à partir du premier…
thenlper/gte-base-zh est un modèle d'embedding d'Alibaba, publié le 8 novembre 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 102 millions de paramètres, tous actifs, et produit pour chaque texte chinois un vecteur dense de 1 024 dimensions à partir du premier token de la dernière couche cachée.
Strictement monolingue chinois, il accepte jusqu'à 512 tokens par entrée. Son entraînement contrastif en plusieurs étapes couvre des paires de textes issues de domaines et de scénarios variés. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la similarité, au clustering et au reranking.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 8 novembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense (un vecteur unique par texte, obtenu à partir du premier token de la dernière couche cachée) |
| Paramètres | 102 millions |
| Paramètres actifs | 102 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Chinese | 65,7 % | 37ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Chinese
Notre analyse
Forces. Son orientation exclusive vers le chinois et son entraînement sur des paires de pertinence le destinent directement à la recherche d'information et à la comparaison sémantique de textes chinois. MTEB Chinese l'évalue sur la recherche, le reranking et la classification de paires, avec un résultat global qui confirme une qualité exploitable sur cet ensemble de tâches. La représentation dense unique facilite son intégration dans des index vectoriels avec Transformers ou Sentence Transformers. La licence MIT autorise l'adaptation, l'auto-hébergement et les usages commerciaux.
Limites et points d'attention. Son rang sur MTEB Chinese le place dans la seconde moitié des modèles évalués, ce qui réduit son intérêt face à des solutions plus performantes. Sa sortie de 1 024 dimensions alourdit davantage le stockage des index et le calcul de similarité qu'une représentation dense plus compacte. La limite de 512 tokens impose de découper les documents longs, tandis que son exclusivité au chinois écarte les corpus multilingues. Sorti en 2023, il est très ancien à l'échelle de l'IA, probablement dépassé par des modèles plus récents et souvent retiré du catalogue de son éditeur. Usages pertinents : recherche sémantique, RAG, clustering et reranking sur des corpus chinois, notamment en environnement auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).