GreenNode/GreenNode-Embedding-Large-VN-V1
GreenNode/GreenNode-Embedding-Large-VN-V1 est un modèle d’embedding de 568 millions de paramètres publié par GreenNode le 11 avril 2024. Spécialisé dans le vietnamien et fondé sur XLM-RoBERTa, il produit des représentations denses de 1024 dimensions à partir de séquences pouvant…
GreenNode/GreenNode-Embedding-Large-VN-V1 est un modèle d’embedding de 568 millions de paramètres publié par GreenNode le 11 avril 2024. Spécialisé dans le vietnamien et fondé sur XLM-RoBERTa, il produit des représentations denses de 1024 dimensions à partir de séquences pouvant atteindre 8192 jetons.
Son architecture Sentence Transformer applique un pooling sur le jeton CLS, puis normalise les vecteurs afin de les comparer par similarité cosinus. Il sert à la recherche sémantique, à l’indexation pour le RAG, à la détection de paraphrases, à la classification et au clustering. Sa licence ouverte CC-BY 4.0 autorise notamment l’auto-hébergement, sous réserve d’attribution.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | GreenNode |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY 4.0 |
| Date de sortie | 11 avril 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 568 millions |
| Paramètres actifs | 568 millions |
| Longueur de séquence max | 8 194 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Vietnamese | 50,5 % | 14ᵉ / 27 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Vietnamese
Notre analyse
Forces. Son évaluation MTEB Vietnamese couvre la recherche, la classification et la comparaison de paires, ce qui correspond à un profil polyvalent pour le traitement sémantique du vietnamien. La limite de 8192 jetons facilite l’encodage de paragraphes étendus et de documents relativement longs, avec moins de découpage avant l’indexation. La normalisation des vecteurs et l’emploi de la similarité cosinus fournissent un schéma directement exploitable dans un moteur vectoriel. La licence CC-BY 4.0 constitue aussi un avantage pratique pour le déploiement et l’adaptation dans une infrastructure contrôlée.
Limites et points d’attention. Son résultat MTEB Vietnamese le place au milieu du classement, au 14e rang sur 27, plutôt que parmi les références de cette évaluation. Ses 568 millions de paramètres impliquent un modèle d’encodage conséquent, tandis que les vecteurs de 1024 dimensions alourdissent l’index, le stockage et le calcul de similarité par rapport à des représentations plus courtes. Sorti en avril 2024, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré du catalogue de son éditeur. Usages pertinents : recherche sémantique en vietnamien, RAG, paraphrases, classification et clustering de textes longs.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).