Vietnamese

MTEB: Vietnamese est un benchmark consacré à la qualité des plongements de texte en vietnamien. Créé en 2025 par les auteurs de VN-MTEB, notamment Pham, Luu et leurs coauteurs, il s’appuie sur des données de MTEB traduites automatiquement, puis filtrées afin de préserver les entités…

MTEB: Vietnamese est un benchmark consacré à la qualité des plongements de texte en vietnamien. Créé en 2025 par les auteurs de VN-MTEB, notamment Pham, Luu et leurs coauteurs, il s’appuie sur des données de MTEB traduites automatiquement, puis filtrées afin de préserver les entités nommées et les extraits de code.

Il évalue les modèles sur six familles de tâches, couvrant notamment la recherche, la classification et la similarité sémantique. Son rôle est de fournir une mesure synthétique et diversifiée des capacités de représentation du vietnamien.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs VN-MTEB (Pham, Luu et al.)
Capacités mesuréesEvalue la qualite des plongements de texte en vietnamien sur 6 types de taches, via des donnees traduites automatiquement depuis MTEB avec filtrage qualite (preservation des entites nommees et extraits de code).
ModalitéTexte
Type de questionsTaches d'embedding de texte (retrieval, reranking, classification, clustering, pair classification, similarite semantique)
Métrique d'évaluationVariable selon la tache (nDCG@10, accuracy, AP, correlation de Spearman) ; score moyen MTEB
AccèsPublic
LanguesVietnamien
Taille du jeu41 jeux de donnees sur 6 taches
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (27)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert63,6 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert63,3 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert62,7 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert61,5 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert59,6 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert57,5 %9 mars 2026✅ Mesuré
7intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert54,7 %8 février 2024✅ Mesuré
8intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert53,8 %8 février 2024✅ Mesuré
9BAAI: bge-m3BAAI🟢 Ouvert53,6 %18 novembre 2025✅ Mesuré
10GreenNode/GreenNode-Embedding-Large-VN-Mixed-V1GreenNode🟢 Ouvert52,9 %11 avril 2024✅ Mesuré
11codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert52,6 %9 mars 2026✅ Mesuré
12Alibaba-NLP/gte-multilingual-baseAlibaba🟢 Ouvert52,4 %20 juillet 2024✅ Mesuré
13Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert51,5 %18 novembre 2025✅ Mesuré
14GreenNode/GreenNode-Embedding-Large-VN-V1GreenNode🟢 Ouvert50,5 %11 avril 2024✅ Mesuré
15codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert50,5 %9 mars 2026✅ Mesuré
16AITeamVN/Vietnamese_EmbeddingAITeamVN🟢 Ouvert50,4 %17 mars 2024✅ Mesuré
17intfloat/multilingual-e5-baseIntfloat🟢 Ouvert49,4 %8 février 2024✅ Mesuré
18contextboxai/halong_embeddingcontextboxai🟢 Ouvert48,6 %6 juillet 2024✅ Mesuré
19intfloat/multilingual-e5-smallIntfloat🟢 Ouvert48,0 %8 février 2024✅ Mesuré
20BAAI/bge-multilingual-gemma2BAAI🟢 Ouvert43,5 %25 juillet 2024✅ Mesuré
21bkai-foundation-models/vietnamese-bi-encoderbkai-foundation-models🟢 Ouvert41,6 %9 septembre 2023✅ Mesuré
22sentence-transformers/LaBSESentence Transformers🟢 Ouvert38,5 %1 novembre 2019✅ Mesuré
23minishlab/potion-multilingual-128Mminishlab🟢 Ouvert35,5 %23 mai 2025✅ Mesuré
24VoVanPhuc/sup-SimCSE-VietNamese-phobert-baseVoVanPhuc🟢 Ouvert34,6 %26 mai 2021✅ Mesuré
25sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert33,9 %15 janvier 2025✅ Mesuré
26Sentence Transformers: all-MiniLM-L12-v2Sentence Transformers🟢 Ouvert30,8 %18 novembre 2025✅ Mesuré
27Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert27,5 %17 novembre 2025✅ Mesuré

Classement établi sur 27 modèles évalués. Score médian de l'ensemble : 50,5 %.

Notre analyse

Un score élevé traduit des plongements efficaces sur plusieurs usages, avec des métriques adaptées à chaque tâche, notamment nDCG@10, accuracy, AP et corrélation de Spearman. Le score moyen MTEB agrège toutefois des évaluations de nature différente et doit donc être lu comme un indicateur global, plutôt que comme une performance uniforme sur chaque tâche.

La rigueur repose sur 41 jeux de données, six types de tâches et un filtrage qualitatif des traductions automatiques. La fiabilité pratique du classement est néanmoins limitée par des scores majoritairement auto-déclarés par les éditeurs, ce qui réduit le degré de vérification indépendante. Sa portée reste centrée sur les plongements de texte en vietnamien et sur des données dérivées de MTEB. Dans la base, codefuse-ai/F2LLM-v2-14B atteint 64 %, contre une médiane de 51 % parmi 27 modèles. Cet écart montre une avance nette du premier modèle, tout en suggérant que le classement n’est pas saturé au niveau observé. Il ne constitue toutefois pas, à lui seul, un contrôle de contamination des données d’évaluation.


Sources des scores : mteb.