Vietnamese
MTEB: Vietnamese est un benchmark consacré à la qualité des plongements de texte en vietnamien. Créé en 2025 par les auteurs de VN-MTEB, notamment Pham, Luu et leurs coauteurs, il s’appuie sur des données de MTEB traduites automatiquement, puis filtrées afin de préserver les entités…
MTEB: Vietnamese est un benchmark consacré à la qualité des plongements de texte en vietnamien. Créé en 2025 par les auteurs de VN-MTEB, notamment Pham, Luu et leurs coauteurs, il s’appuie sur des données de MTEB traduites automatiquement, puis filtrées afin de préserver les entités nommées et les extraits de code.
Il évalue les modèles sur six familles de tâches, couvrant notamment la recherche, la classification et la similarité sémantique. Son rôle est de fournir une mesure synthétique et diversifiée des capacités de représentation du vietnamien.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs VN-MTEB (Pham, Luu et al.) |
| Capacités mesurées | Evalue la qualite des plongements de texte en vietnamien sur 6 types de taches, via des donnees traduites automatiquement depuis MTEB avec filtrage qualite (preservation des entites nommees et extraits de code). |
| Modalité | Texte |
| Type de questions | Taches d'embedding de texte (retrieval, reranking, classification, clustering, pair classification, similarite semantique) |
| Métrique d'évaluation | Variable selon la tache (nDCG@10, accuracy, AP, correlation de Spearman) ; score moyen MTEB |
| Accès | Public |
| Langues | Vietnamien |
| Taille du jeu | 41 jeux de donnees sur 6 taches |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (27)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 63,6 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 63,3 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 62,7 % | 9 mars 2026 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 61,5 % | 9 mars 2026 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 59,6 % | 9 mars 2026 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 57,5 % | 9 mars 2026 | ✅ Mesuré |
| 7 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 54,7 % | 8 février 2024 | ✅ Mesuré |
| 8 | intfloat/e5-mistral-7b-instruct | Intfloat | 🟢 Ouvert | 53,8 % | 8 février 2024 | ✅ Mesuré |
| 9 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 53,6 % | 18 novembre 2025 | ✅ Mesuré |
| 10 | GreenNode/GreenNode-Embedding-Large-VN-Mixed-V1 | GreenNode | 🟢 Ouvert | 52,9 % | 11 avril 2024 | ✅ Mesuré |
| 11 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 52,6 % | 9 mars 2026 | ✅ Mesuré |
| 12 | Alibaba-NLP/gte-multilingual-base | Alibaba | 🟢 Ouvert | 52,4 % | 20 juillet 2024 | ✅ Mesuré |
| 13 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 51,5 % | 18 novembre 2025 | ✅ Mesuré |
| 14 | GreenNode/GreenNode-Embedding-Large-VN-V1 | GreenNode | 🟢 Ouvert | 50,5 % | 11 avril 2024 | ✅ Mesuré |
| 15 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 50,5 % | 9 mars 2026 | ✅ Mesuré |
| 16 | AITeamVN/Vietnamese_Embedding | AITeamVN | 🟢 Ouvert | 50,4 % | 17 mars 2024 | ✅ Mesuré |
| 17 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 49,4 % | 8 février 2024 | ✅ Mesuré |
| 18 | contextboxai/halong_embedding | contextboxai | 🟢 Ouvert | 48,6 % | 6 juillet 2024 | ✅ Mesuré |
| 19 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 48,0 % | 8 février 2024 | ✅ Mesuré |
| 20 | BAAI/bge-multilingual-gemma2 | BAAI | 🟢 Ouvert | 43,5 % | 25 juillet 2024 | ✅ Mesuré |
| 21 | bkai-foundation-models/vietnamese-bi-encoder | bkai-foundation-models | 🟢 Ouvert | 41,6 % | 9 septembre 2023 | ✅ Mesuré |
| 22 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 38,5 % | 1 novembre 2019 | ✅ Mesuré |
| 23 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 35,5 % | 23 mai 2025 | ✅ Mesuré |
| 24 | VoVanPhuc/sup-SimCSE-VietNamese-phobert-base | VoVanPhuc | 🟢 Ouvert | 34,6 % | 26 mai 2021 | ✅ Mesuré |
| 25 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 33,9 % | 15 janvier 2025 | ✅ Mesuré |
| 26 | Sentence Transformers: all-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 30,8 % | 18 novembre 2025 | ✅ Mesuré |
| 27 | Sentence Transformers: all-MiniLM-L6-v2 | Sentence Transformers | 🟢 Ouvert | 27,5 % | 17 novembre 2025 | ✅ Mesuré |
Classement établi sur 27 modèles évalués. Score médian de l'ensemble : 50,5 %.
Notre analyse
Un score élevé traduit des plongements efficaces sur plusieurs usages, avec des métriques adaptées à chaque tâche, notamment nDCG@10, accuracy, AP et corrélation de Spearman. Le score moyen MTEB agrège toutefois des évaluations de nature différente et doit donc être lu comme un indicateur global, plutôt que comme une performance uniforme sur chaque tâche.
La rigueur repose sur 41 jeux de données, six types de tâches et un filtrage qualitatif des traductions automatiques. La fiabilité pratique du classement est néanmoins limitée par des scores majoritairement auto-déclarés par les éditeurs, ce qui réduit le degré de vérification indépendante. Sa portée reste centrée sur les plongements de texte en vietnamien et sur des données dérivées de MTEB. Dans la base, codefuse-ai/F2LLM-v2-14B atteint 64 %, contre une médiane de 51 % parmi 27 modèles. Cet écart montre une avance nette du premier modèle, tout en suggérant que le classement n’est pas saturé au niveau observé. Il ne constitue toutefois pas, à lui seul, un contrôle de contamination des données d’évaluation.
Sources des scores : mteb.