IEITYuan/Yuan-embedding-2.0-en
IEITYuan/Yuan-embedding-2.0-en est un modèle d’embedding dense de 596 millions de paramètres, tous actifs, publié par IEITYuan le 27 novembre 2025. Fondé sur Qwen/Qwen3-Embedding-0.6B, il produit des vecteurs de 1024 dimensions et cible principalement les textes en anglais.
IEITYuan/Yuan-embedding-2.0-en est un modèle d’embedding dense de 596 millions de paramètres, tous actifs, publié par IEITYuan le 27 novembre 2025. Fondé sur Qwen/Qwen3-Embedding-0.6B, il produit des vecteurs de 1024 dimensions et cible principalement les textes en anglais.
Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes de recherche sémantique, de RAG, de similarité documentaire ou de clustering. Son entraînement associe une perte multitâche, Matryoshka Representation Learning et InfoNCE avec des négatifs intra-lot.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | IEITYuan |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 27 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Thai | 57,8 % | 22ᵉ / 28 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Thai
Notre analyse
Forces. Le modèle est spécifiquement optimisé pour le retrieval et le reranking, deux fonctions centrales pour retrouver et ordonner des passages dans un moteur sémantique ou un pipeline RAG. Matryoshka Representation Learning vise à rendre les représentations exploitables à plusieurs niveaux de dimension, tandis qu’InfoNCE avec négatifs intra-lot favorise la distinction entre textes proches et non pertinents. L’intégration avec SentenceTransformers, la normalisation des embeddings et le calcul de similarité par produit matriciel facilitent une mise en œuvre standard. La licence Apache 2.0 autorise l’auto-hébergement et l’adaptation du modèle.
Limites et points d'attention. Sa spécialisation anglophone limite son adéquation aux corpus multilingues. Sur le track Thai de MTEB, il se situe dans le bas du classement, ce qui invite à la prudence pour les contenus thaïlandais. Les vecteurs denses de 1024 dimensions impliquent aussi des index plus lourds et davantage de calcul lors des recherches que des représentations de dimension inférieure. Il reste un modèle d’embedding, destiné à représenter et comparer des textes, sans génération de contenu. Les usages pertinents sont la recherche sémantique en anglais, le retrieval pour le RAG, le reranking, la similarité et le clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).