Korean

MTEB: Korean est une déclinaison du Massive Text Embedding Benchmark consacrée aux représentations vectorielles de textes coréens. Créée par les contributeurs de MTEB, cette suite étendue succède à MTEB(kor, v1) et couvre un éventail élargi de tâches fondées sur des textes, des paires de…

MTEB: Korean est une déclinaison du Massive Text Embedding Benchmark consacrée aux représentations vectorielles de textes coréens. Créée par les contributeurs de MTEB, cette suite étendue succède à MTEB(kor, v1) et couvre un éventail élargi de tâches fondées sur des textes, des paires de phrases, des corpus et des ensembles à regrouper.

Elle mesure la qualité générale des embeddings pour plusieurs usages, de l’analyse sémantique à la recherche d’information. Son agrégation de métriques adaptées à chaque tâche fournit un repère synthétique pour comparer la polyvalence des modèles sur le coréen.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB (Massive Text Embedding Benchmark) contributors
Capacités mesuréesMesure la qualité générale des embeddings de textes coréens pour la classification, le regroupement, l’inférence et la comparaison de paires, le reranking, la recherche d’information et la similarité sémantique.
ModalitéTexte
Type de questionsTextes étiquetés, paires de phrases, requêtes avec corpus de documents et ensembles de textes à regrouper, selon la tâche
Métrique d'évaluationScore moyen agrégé de métriques propres à chaque tâche, notamment accuracy, F1, corrélation de Spearman, V-measure, MAP et nDCG@10
AccèsPublic
Languescoréen
Taille du jeu20 tâches
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (23)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen: Qwen3 Embedding 8BQwen🟢 Ouvert77,7 %28 octobre 2025✅ Mesuré
2Qwen: Qwen3 Embedding 4BQwen🟢 Ouvert76,9 %28 octobre 2025✅ Mesuré
3codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert76,8 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert76,4 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert74,9 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert74,3 %9 mars 2026✅ Mesuré
7codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert72,2 %9 mars 2026✅ Mesuré
8nlpai-lab/KURE-v1nlpai-lab🟢 Ouvert72,0 %18 décembre 2024✅ Mesuré
9dragonkue/snowflake-arctic-embed-l-v2.0-kodragonkue🟢 Ouvert71,6 %7 mars 2025✅ Mesuré
10telepix/PIXIE-Rune-v1.5telepix🟢 Ouvert71,3 %22 avril 2026✅ Mesuré
11dragonkue/BGE-m3-kodragonkue🟢 Ouvert70,9 %17 septembre 2024✅ Mesuré
12nlpai-lab/KoE5nlpai-lab🟢 Ouvert70,4 %24 septembre 2024✅ Mesuré
13hotchpotch/bekko-embedding-v1-a25mhotchpotch🟢 Ouvert67,9 %28 juillet 2026✅ Mesuré
14nomic-ai/nomic-embed-text-v2-moeNomic AI🟢 Ouvert67,6 %7 février 2025✅ Mesuré
15BAAI/bge-multilingual-gemma2BAAI🟢 Ouvert67,4 %25 juillet 2024✅ Mesuré
16dragonkue/multilingual-e5-small-ko-v2dragonkue🟢 Ouvert67,3 %10 juin 2025✅ Mesuré
17Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert67,2 %4 décembre 2024✅ Mesuré
18dragonkue/multilingual-e5-small-kodragonkue🟢 Ouvert67,1 %11 mai 2025✅ Mesuré
19hotchpotch/bekko-embedding-v1-a8mhotchpotch🟢 Ouvert64,8 %28 juillet 2026✅ Mesuré
20intfloat/multilingual-e5-smallIntfloat🟢 Ouvert64,3 %8 février 2024✅ Mesuré
21codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert59,0 %9 mars 2026✅ Mesuré
22minishlab/potion-multilingual-128Mminishlab🟢 Ouvert47,2 %23 mai 2025✅ Mesuré
23sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert40,1 %15 janvier 2025✅ Mesuré

Classement établi sur 23 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 70,4 %.

Notre analyse

Un score élevé indique qu’un modèle produit des embeddings efficaces sur l’ensemble des tâches, malgré des protocoles et des métriques variés. Il reflète donc une performance transversale, et non une aptitude isolée à un seul usage. L’agrégation facilite la comparaison, mais peut masquer des écarts entre catégories de tâches. Parmi les 23 modèles évalués dans la base, Qwen: Qwen3 Embedding 8B domine avec 78 %, contre une médiane de 70 %. Cet écart de huit points montre une différenciation nette entre la tête du classement et le niveau central. Il ne suffit toutefois pas à exclure une saturation sur certaines tâches prises séparément. La portée du résultat reste limitée aux embeddings de textes coréens et aux familles d’épreuves couvertes. La fiabilité appelle également de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une évaluation indépendante. Enfin, l’accès public au benchmark fait de la contamination un risque méthodologique à considérer, sans établir qu’elle s’est produite.


Sources des scores : mteb.