Korean
MTEB: Korean est une déclinaison du Massive Text Embedding Benchmark consacrée aux représentations vectorielles de textes coréens. Créée par les contributeurs de MTEB, cette suite étendue succède à MTEB(kor, v1) et couvre un éventail élargi de tâches fondées sur des textes, des paires de…
MTEB: Korean est une déclinaison du Massive Text Embedding Benchmark consacrée aux représentations vectorielles de textes coréens. Créée par les contributeurs de MTEB, cette suite étendue succède à MTEB(kor, v1) et couvre un éventail élargi de tâches fondées sur des textes, des paires de phrases, des corpus et des ensembles à regrouper.
Elle mesure la qualité générale des embeddings pour plusieurs usages, de l’analyse sémantique à la recherche d’information. Son agrégation de métriques adaptées à chaque tâche fournit un repère synthétique pour comparer la polyvalence des modèles sur le coréen.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB (Massive Text Embedding Benchmark) contributors |
| Capacités mesurées | Mesure la qualité générale des embeddings de textes coréens pour la classification, le regroupement, l’inférence et la comparaison de paires, le reranking, la recherche d’information et la similarité sémantique. |
| Modalité | Texte |
| Type de questions | Textes étiquetés, paires de phrases, requêtes avec corpus de documents et ensembles de textes à regrouper, selon la tâche |
| Métrique d'évaluation | Score moyen agrégé de métriques propres à chaque tâche, notamment accuracy, F1, corrélation de Spearman, V-measure, MAP et nDCG@10 |
| Accès | Public |
| Langues | coréen |
| Taille du jeu | 20 tâches |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen: Qwen3 Embedding 8B | Qwen | 🟢 Ouvert | 77,7 % | 28 octobre 2025 | ✅ Mesuré |
| 2 | Qwen: Qwen3 Embedding 4B | Qwen | 🟢 Ouvert | 76,9 % | 28 octobre 2025 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 76,8 % | 9 mars 2026 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 76,4 % | 9 mars 2026 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 74,9 % | 9 mars 2026 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 74,3 % | 9 mars 2026 | ✅ Mesuré |
| 7 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 72,2 % | 9 mars 2026 | ✅ Mesuré |
| 8 | nlpai-lab/KURE-v1 | nlpai-lab | 🟢 Ouvert | 72,0 % | 18 décembre 2024 | ✅ Mesuré |
| 9 | dragonkue/snowflake-arctic-embed-l-v2.0-ko | dragonkue | 🟢 Ouvert | 71,6 % | 7 mars 2025 | ✅ Mesuré |
| 10 | telepix/PIXIE-Rune-v1.5 | telepix | 🟢 Ouvert | 71,3 % | 22 avril 2026 | ✅ Mesuré |
| 11 | dragonkue/BGE-m3-ko | dragonkue | 🟢 Ouvert | 70,9 % | 17 septembre 2024 | ✅ Mesuré |
| 12 | nlpai-lab/KoE5 | nlpai-lab | 🟢 Ouvert | 70,4 % | 24 septembre 2024 | ✅ Mesuré |
| 13 | hotchpotch/bekko-embedding-v1-a25m | hotchpotch | 🟢 Ouvert | 67,9 % | 28 juillet 2026 | ✅ Mesuré |
| 14 | nomic-ai/nomic-embed-text-v2-moe | Nomic AI | 🟢 Ouvert | 67,6 % | 7 février 2025 | ✅ Mesuré |
| 15 | BAAI/bge-multilingual-gemma2 | BAAI | 🟢 Ouvert | 67,4 % | 25 juillet 2024 | ✅ Mesuré |
| 16 | dragonkue/multilingual-e5-small-ko-v2 | dragonkue | 🟢 Ouvert | 67,3 % | 10 juin 2025 | ✅ Mesuré |
| 17 | Snowflake/snowflake-arctic-embed-l-v2.0 | Snowflake | 🟢 Ouvert | 67,2 % | 4 décembre 2024 | ✅ Mesuré |
| 18 | dragonkue/multilingual-e5-small-ko | dragonkue | 🟢 Ouvert | 67,1 % | 11 mai 2025 | ✅ Mesuré |
| 19 | hotchpotch/bekko-embedding-v1-a8m | hotchpotch | 🟢 Ouvert | 64,8 % | 28 juillet 2026 | ✅ Mesuré |
| 20 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 64,3 % | 8 février 2024 | ✅ Mesuré |
| 21 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 59,0 % | 9 mars 2026 | ✅ Mesuré |
| 22 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 47,2 % | 23 mai 2025 | ✅ Mesuré |
| 23 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 40,1 % | 15 janvier 2025 | ✅ Mesuré |
Classement établi sur 23 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 70,4 %.
Notre analyse
Un score élevé indique qu’un modèle produit des embeddings efficaces sur l’ensemble des tâches, malgré des protocoles et des métriques variés. Il reflète donc une performance transversale, et non une aptitude isolée à un seul usage. L’agrégation facilite la comparaison, mais peut masquer des écarts entre catégories de tâches. Parmi les 23 modèles évalués dans la base, Qwen: Qwen3 Embedding 8B domine avec 78 %, contre une médiane de 70 %. Cet écart de huit points montre une différenciation nette entre la tête du classement et le niveau central. Il ne suffit toutefois pas à exclure une saturation sur certaines tâches prises séparément. La portée du résultat reste limitée aux embeddings de textes coréens et aux familles d’épreuves couvertes. La fiabilité appelle également de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une évaluation indépendante. Enfin, l’accès public au benchmark fait de la contamination un risque méthodologique à considérer, sans établir qu’elle s’est produite.
Sources des scores : mteb.