SamilPwC-AXNode-GenAI/PwC-Embedding_expr
SamilPwC-AXNode-GenAI/PwC-Embedding_expr est un modèle d'embedding multilingue de 560 millions de paramètres, publié le 12 août 2025 par SamilPwC-AXNode-GenAI. Dérivé de multilingual-e5-large-instruct, il produit des vecteurs de dimension 1024 et accepte jusqu'à 514 tokens en entrée.
SamilPwC-AXNode-GenAI/PwC-Embedding_expr est un modèle d'embedding multilingue de 560 millions de paramètres, publié le 12 août 2025 par SamilPwC-AXNode-GenAI. Dérivé de multilingual-e5-large-instruct, il produit des vecteurs de dimension 1024 et accepte jusqu'à 514 tokens en entrée.
Le modèle sert à indexer et comparer des textes pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Son entraînement associe une augmentation curée de jeux de données STS à un fine-tuning équilibré entre jeux de données, avec un accent sur le coréen. La licence Apache 2.0 autorise des déploiements et adaptations selon ses conditions.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | SamilPwC-AXNode-GenAI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 12 août 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | vecteurs d'embedding de dimension 1024 |
| Paramètres | 560 millions |
| Paramètres actifs | 560 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Korean | 77,0 % | 1ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Thai | 58,6 % | 20ᵉ / 28 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Korean
MTEB: Thai
Notre analyse
Forces. PwC-Embedding_expr se distingue surtout en coréen, où MTEB le place en tête du classement évalué. Ce résultat couvre plusieurs familles de tâches, notamment la classification, le reranking et la recherche de passages, ce qui en fait un candidat solide pour des moteurs de recherche sémantique et des pipelines RAG en coréen. Son origine multilingue permet également de traiter d'autres langues. Les vecteurs de 1024 dimensions offrent une représentation détaillée, tandis que la licence Apache 2.0 facilite l'auto-hébergement, l'intégration et l'adaptation du modèle.
Limites et points d'attention. Les résultats MTEB en thaï se situent dans la partie basse du classement évalué, malgré une couverture de tâches comprenant classification, clustering et pair classification. Les performances multilingues apparaissent donc inégales selon la langue. La limite de 514 tokens impose aussi de segmenter les documents longs avant leur indexation. Enfin, des vecteurs de 1024 dimensions produisent des index plus volumineux et peuvent rendre la recherche plus coûteuse que des embeddings de dimension inférieure. Le modèle reste expérimental et en développement continu. Usages pertinents : recherche sémantique, RAG, similarité textuelle et clustering, particulièrement sur des corpus coréens.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).