shibing624/text2vec-base-chinese
Publié par shibing624 le 23 janvier 2022 sous licence ouverte Apache 2.0, shibing624/text2vec-base-chinese est un modèle d’embedding chinois de 102 millions de paramètres. Fondé sur hfl/chinese-macbert-base et affiné selon l’approche CoSENT, il produit des représentations denses de 768…
Publié par shibing624 le 23 janvier 2022 sous licence ouverte Apache 2.0, shibing624/text2vec-base-chinese est un modèle d’embedding chinois de 102 millions de paramètres. Fondé sur hfl/chinese-macbert-base et affiné selon l’approche CoSENT, il produit des représentations denses de 768 dimensions par mean pooling.
Le modèle encode des phrases et de courts paragraphes chinois pour la recherche sémantique, la récupération de passages dans un système RAG, le clustering, la similarité de phrases et la mise en correspondance de textes. Il s’exécute avec text2vec, Transformers ou sentence-transformers, avec des variantes ONNX, OpenVINO et int8.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | shibing624 |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 23 janvier 2022 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 102 millions |
| Paramètres actifs | 102 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 13,8 % | 198ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 4,1 % | 96ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 15,2 % | 95ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 1,3 % | 199ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 3,0 % | 203ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Legal
Notre analyse
Forces. Son objectif contrastif associé à une perte de classement vise directement la proximité sémantique et l’ordonnancement des résultats. Parmi ses évaluations RTEB, les domaines financier et juridique constituent ses résultats relativement les moins faibles, sans toutefois le placer à un rang compétitif. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Les variantes ONNX, OpenVINO et quantifiée int8 facilitent différents scénarios de déploiement, tandis que ses 102 millions de paramètres restent adaptés à une exploitation locale.
Limites et points d'attention. Les résultats RTEB sont faibles dans l’ensemble, avec des classements proches du bas des tableaux en finance, droit, santé, allemand et français. La santé est particulièrement difficile, tandis que les évaluations en allemand et en français confirment que ce modèle centré sur le chinois n’est pas un choix pertinent pour la recherche multilingue. Ses vecteurs denses de 768 dimensions impliquent aussi des index plus volumineux et une recherche plus coûteuse que des représentations de dimension inférieure. Sorti il y a environ quatre ans, il appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues d’éditeurs. Usages pertinents : prototypes et systèmes auto-hébergés de recherche, RAG, similarité ou clustering portant sur des phrases et courts paragraphes chinois.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).