IEITYuan/Yuan-embedding-2.0-zh

Publié le 24 novembre 2025 par IEITYuan, IEITYuan/Yuan-embedding-2.0-zh est un modèle d’embedding de 327 millions de paramètres, spécialisé dans la recherche de textes en chinois. Il produit des vecteurs de 1 792 dimensions et peut appliquer une normalisation lors de l’encodage avec…

Publié le 24 novembre 2025 par IEITYuan, IEITYuan/Yuan-embedding-2.0-zh est un modèle d’embedding de 327 millions de paramètres, spécialisé dans la recherche de textes en chinois. Il produit des vecteurs de 1 792 dimensions et peut appliquer une normalisation lors de l’encodage avec SentenceTransformer.

Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes de recherche sémantique, de RAG, de détection de similarité ou de clustering. Son entraînement cible particulièrement le retrieval et le reranking, avec des données augmentées, des exemples négatifs difficiles et des données synthétiques réécrites par LLM.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIEITYuan
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie24 novembre 2025
Dimension du vecteur1 792
Représentationembeddings via SentenceTransformer (model.encode), avec normalisation optionnelle
Paramètres327 millions
Paramètres actifs327 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chinese72,6 %10ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Chinese

▶ IEITYuan/Yuan-embedding…73 %
lier007/xiaobu-embeddin…72 %

Notre analyse

Forces. Yuan-embedding-2.0-zh se classe dans le top 10 de MTEB: Chinese, une évaluation couvrant notamment le retrieval, le reranking et la classification de paires. Ce positionnement indique une qualité solide pour rapprocher requêtes et passages chinois, ordonner des résultats et mesurer la proximité entre textes. L’apprentissage combine plusieurs objectifs, dont Multi-Task, Matryoshka Representation Learning, InfoNCE et Margin-Adaptive Pairwise Ranking Loss. Le hard negative sampling vise à mieux distinguer des contenus sémantiquement proches. La licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et l’intégration dans des infrastructures privées.

Limites et points d'attention. Les vecteurs de 1 792 dimensions imposent des index plus volumineux et davantage de calcul lors des recherches de similarité qu’une représentation de dimension plus réduite. Les 327 millions de paramètres actifs pèsent également sur les ressources nécessaires à l’encodage. La spécialisation dans la recherche de textes chinois oriente son intérêt vers des corpus et requêtes dans cette langue. La normalisation optionnelle doit rester cohérente entre l’indexation et les requêtes, notamment lorsque la similarité est calculée par produit matriciel. Usages pertinents : recherche sémantique chinoise, sélection de passages pour RAG, reranking, déduplication, similarité et clustering de textes chinois.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).