shibing624/text2vec-base-chinese

Publié par shibing624 le 23 janvier 2022 sous licence ouverte Apache 2.0, shibing624/text2vec-base-chinese est un modèle d’embedding chinois de 102 millions de paramètres. Fondé sur hfl/chinese-macbert-base et affiné selon l’approche CoSENT, il produit des représentations denses de 768…

Publié par shibing624 le 23 janvier 2022 sous licence ouverte Apache 2.0, shibing624/text2vec-base-chinese est un modèle d’embedding chinois de 102 millions de paramètres. Fondé sur hfl/chinese-macbert-base et affiné selon l’approche CoSENT, il produit des représentations denses de 768 dimensions par mean pooling.

Le modèle encode des phrases et de courts paragraphes chinois pour la recherche sémantique, la récupération de passages dans un système RAG, le clustering, la similarité de phrases et la mise en correspondance de textes. Il s’exécute avec text2vec, Transformers ou sentence-transformers, avec des variantes ONNX, OpenVINO et int8.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurshibing624
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie23 janvier 2022
Dimension du vecteur768
Représentationdense
Paramètres102 millions
Paramètres actifs102 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal13,8 %198ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare4,1 %96ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance15,2 %95ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French1,3 %199ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German3,0 %203ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ shibing624/text2vec-bas…15 %

MTEB: RTEB Legal

▶ shibing624/text2vec-bas…14 %
malenia1/ternary-weight…11 %

Notre analyse

Forces. Son objectif contrastif associé à une perte de classement vise directement la proximité sémantique et l’ordonnancement des résultats. Parmi ses évaluations RTEB, les domaines financier et juridique constituent ses résultats relativement les moins faibles, sans toutefois le placer à un rang compétitif. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Les variantes ONNX, OpenVINO et quantifiée int8 facilitent différents scénarios de déploiement, tandis que ses 102 millions de paramètres restent adaptés à une exploitation locale.

Limites et points d'attention. Les résultats RTEB sont faibles dans l’ensemble, avec des classements proches du bas des tableaux en finance, droit, santé, allemand et français. La santé est particulièrement difficile, tandis que les évaluations en allemand et en français confirment que ce modèle centré sur le chinois n’est pas un choix pertinent pour la recherche multilingue. Ses vecteurs denses de 768 dimensions impliquent aussi des index plus volumineux et une recherche plus coûteuse que des représentations de dimension inférieure. Sorti il y a environ quatre ans, il appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues d’éditeurs. Usages pertinents : prototypes et systèmes auto-hébergés de recherche, RAG, similarité ou clustering portant sur des phrases et courts paragraphes chinois.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).