GreenNode/GreenNode-Embedding-Large-VN-Mixed-V1

Publié par GreenNode le 11 avril 2024, GreenNode/GreenNode-Embedding-Large-VN-Mixed-V1 est un modèle d'embedding de 568 millions de paramètres, tous actifs, spécialisé dans le vietnamien. Fondé sur XLMRobertaModel, il produit des représentations denses de 1 024 dimensions et accepte des…

Publié par GreenNode le 11 avril 2024, GreenNode/GreenNode-Embedding-Large-VN-Mixed-V1 est un modèle d'embedding de 568 millions de paramètres, tous actifs, spécialisé dans le vietnamien. Fondé sur XLMRobertaModel, il produit des représentations denses de 1 024 dimensions et accepte des séquences allant jusqu'à 8 192 tokens.

Il sert à indexer phrases, paragraphes et documents pour la recherche sémantique, la récupération de contexte dans un système RAG, la détection de paraphrases, la classification et le clustering. Sa licence ouverte CC-BY 4.0 autorise sa réutilisation et son auto-hébergement avec attribution.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGreenNode
Poids🟢 Poids ouverts
LicenceCC-BY 4.0
Date de sortie11 avril 2024
Dimension du vecteur1 024
Représentationdense
Paramètres568 millions
Paramètres actifs568 millions
Longueur de séquence max8 194 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Vietnamese52,9 %10ᵉ / 27mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Vietnamese

bge-m354 %
▶ GreenNode/GreenNode-Emb…53 %

Notre analyse

Forces. Le modèle se classe dans le top 10 du benchmark MTEB Vietnamese, qui couvre la recherche, la classification et la comparaison de paires de textes. Ce résultat en fait une option crédible pour organiser et retrouver des contenus vietnamiens selon leur sens. Sa fenêtre de 8 192 tokens convient à l'encodage de documents relativement longs. Le pooling sur le token CLS, la normalisation des vecteurs et la similarité cosinus forment une chaîne adaptée aux index vectoriels. L'entraînement mentionne GreenNode/GreenNode-Table-Markdown-Retrieval-VN, ce qui l'oriente notamment vers la récupération de contenus vietnamiens structurés en tableaux et en Markdown.

Limites et points d'attention. Avec 568 millions de paramètres actifs, le modèle est plus lourd à exécuter que de petits encodeurs. Ses vecteurs de 1 024 dimensions augmentent aussi la taille des index, la mémoire requise et le coût des recherches par rapport à des représentations plus compactes. Sorti il y a environ deux ans, soit une ancienneté très importante à l'échelle de l'IA, il doit être comparé aux solutions plus récentes de sa catégorie, susceptibles de l'avoir dépassé, et aux modèles encore maintenus dans les catalogues actuels. Ses usages pertinents sont la recherche sémantique, le RAG, la similarité, la classification et le clustering de textes vietnamiens.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).