Korean

MTEB: Korean est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des plongements de texte en coréen. Il couvre plusieurs usages complémentaires : classification, reranking, recherche d’information et similarité sémantique.

MTEB: Korean est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des plongements de texte en coréen. Il couvre plusieurs usages complémentaires : classification, reranking, recherche d’information et similarité sémantique.

Son rôle est de comparer la capacité des modèles d’embedding à produire des représentations utiles selon différents types de tâches. Les métriques étant adaptées à chaque tâche, leur agrégation dans un score moyen MTEB fournit une vue synthétique des performances, tout en conservant une évaluation fondée sur plusieurs dimensions.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / MMTEB (communaute embeddings-benchmark)
Capacités mesuréesEvalue la qualite des plongements de texte en coreen sur la classification, le reranking, la recherche et la similarite semantique.
ModalitéTexte
Type de questionsTaches d'embedding de texte (classification, reranking, retrieval, similarite semantique)
Métrique d'évaluationVariable selon la tache (nDCG@10, accuracy, correlation de Spearman) ; score moyen MTEB
AccèsPublic
LicenceApache-2.0 (cadre MTEB) ; licences des jeux de donnees variables
LanguesCoreen
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (102)

#ModèleÉditeurLicenceScoreSortieFiabilité
1SamilPwC-AXNode-GenAI/PwC-Embedding_exprSamilPwC-AXNode-GenAI🟢 Ouvert77,0 %12 août 2025✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert75,1 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert74,9 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert73,8 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert73,6 %9 mars 2026✅ Mesuré
6intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert70,9 %8 février 2024✅ Mesuré
7codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert70,9 %9 mars 2026✅ Mesuré
8Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert69,7 %4 décembre 2024✅ Mesuré
9Alibaba-NLP/gte-multilingual-baseAlibaba🟢 Ouvert69,3 %20 juillet 2024✅ Mesuré
10jinaai/jina-embeddings-v3Jina AI🟢 Ouvert69,1 %18 septembre 2024✅ Mesuré
11codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert68,7 %9 mars 2026✅ Mesuré
12OrdalieTech/Solon-embeddings-large-0.1OrdalieTech🟢 Ouvert68,3 %9 décembre 2023✅ Mesuré
13Salesforce/SFR-Embedding-2_RSalesforce🟢 Ouvert68,2 %14 juin 2024✅ Mesuré
14intfloat/multilingual-e5-baseIntfloat🟢 Ouvert67,7 %8 février 2024✅ Mesuré
15intfloat/multilingual-e5-smallIntfloat🟢 Ouvert66,8 %8 février 2024✅ Mesuré
16Lajavaness/bilingual-embedding-baseLajavaness🟢 Ouvert66,4 %26 juin 2024✅ Mesuré
17Lajavaness/bilingual-embedding-smallLajavaness🟢 Ouvert64,1 %17 juillet 2024✅ Mesuré
18ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert63,6 %18 décembre 2024✅ Mesuré
19codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert62,6 %9 mars 2026✅ Mesuré
20ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert62,4 %18 décembre 2024✅ Mesuré
21Snowflake/snowflake-arctic-embed-m-v2.0Snowflake🟢 Ouvert60,8 %4 décembre 2024✅ Mesuré
22codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert60,0 %9 mars 2026✅ Mesuré
23Omartificial-Intelligence-Space/Arabic-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert57,2 %14 juin 2024✅ Mesuré
24sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert55,7 %1 novembre 2019✅ Mesuré
25Gameselo/STS-multilingual-mpnet-base-v2Gameselo🟢 Ouvert54,1 %7 juin 2024✅ Mesuré
26Omartificial-Intelligence-Space/Arabic-labse-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert53,1 %16 juin 2024✅ Mesuré
27Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert51,2 %25 juin 2024✅ Mesuré
28sentence-transformers/LaBSESentence Transformers🟢 Ouvert49,7 %1 novembre 2019✅ Mesuré
29sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert47,9 %1 novembre 2019✅ Mesuré
30shibing624/text2vec-base-multilingualshibing624🟢 Ouvert38,3 %22 juin 2023✅ Mesuré
31sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert36,4 %15 janvier 2025✅ Mesuré
32avsolatorio/GIST-large-Embedding-v0avsolatorio🟢 Ouvert24,3 %14 février 2024✅ Mesuré
33BAAI: bge-base-en-v1.5BAAI🟢 Ouvert24,0 %18 novembre 2025✅ Mesuré
34WhereIsAI/UAE-Large-V1WhereIsAI🟢 Ouvert23,9 %4 décembre 2023✅ Mesuré
35nomic-ai/nomic-embed-text-v1.5Nomic AI🟢 Ouvert23,5 %10 février 2024✅ Mesuré
36Mihaiii/IvysaurMihaiii🟢 Ouvert22,9 %27 avril 2024✅ Mesuré
37avsolatorio/GIST-Embedding-v0avsolatorio🟢 Ouvert22,7 %31 janvier 2024✅ Mesuré
38mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert22,7 %7 mars 2024✅ Mesuré
39nomic-ai/nomic-embed-text-v1Nomic AI🟢 Ouvert22,5 %31 janvier 2024✅ Mesuré
40Intfloat: E5-Large-v2Intfloat🟢 Ouvert22,2 %18 novembre 2025✅ Mesuré
41BAAI: bge-large-en-v1.5BAAI🟢 Ouvert22,1 %18 novembre 2025✅ Mesuré
42intfloat/e5-largeIntfloat🟢 Ouvert22,0 %26 décembre 2022✅ Mesuré
43nomic-ai/nomic-embed-text-v1-unsupervisedNomic AI🟢 Ouvert22,0 %15 janvier 2024✅ Mesuré
44Mihaiii/BulbasaurMihaiii🟢 Ouvert21,8 %27 avril 2024✅ Mesuré
45infgrad/stella-base-en-v2infgrad🟢 Ouvert21,3 %19 octobre 2023✅ Mesuré
46ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert21,3 %18 décembre 2024✅ Mesuré
47Mihaiii/VenusaurMihaiii🟢 Ouvert21,2 %29 avril 2024✅ Mesuré
48Mihaiii/WartortleMihaiii🟢 Ouvert21,1 %30 avril 2024✅ Mesuré
49NovaSearch/stella_en_400M_v5NovaSearch🟢 Ouvert21,0 %12 juillet 2024✅ Mesuré
50BAAI/bge-small-en-v1.5BAAI🟢 Ouvert20,8 %12 septembre 2023✅ Mesuré
51Mihaiii/SquirtleMihaiii🟢 Ouvert20,7 %30 avril 2024✅ Mesuré
52intfloat/e5-baseIntfloat🟢 Ouvert20,5 %26 décembre 2022✅ Mesuré
53avsolatorio/GIST-small-Embedding-v0avsolatorio🟢 Ouvert20,4 %3 février 2024✅ Mesuré
54Snowflake/snowflake-arctic-embed-mSnowflake🟢 Ouvert20,0 %12 avril 2024✅ Mesuré
55minishlab/potion-base-8Mminishlab🟢 Ouvert20,0 %29 octobre 2024✅ Mesuré
56abhinand/MedEmbed-small-v0.1abhinand🟢 Ouvert19,9 %20 octobre 2024✅ Mesuré
57thenlper/gte-smallAlibaba🟢 Ouvert19,9 %27 juillet 2023✅ Mesuré
58Mihaiii/gte-micro-v4Mihaiii🟢 Ouvert19,6 %22 avril 2024✅ Mesuré
59Intfloat: E5-Base-v2Intfloat🟢 Ouvert19,3 %18 novembre 2025✅ Mesuré
60minishlab/M2V_base_glove_subwordminishlab🟢 Ouvert19,2 %21 septembre 2024✅ Mesuré
61minishlab/potion-base-4Mminishlab🟢 Ouvert19,2 %29 octobre 2024✅ Mesuré
62minishlab/M2V_base_outputminishlab🟢 Ouvert19,2 %21 septembre 2024✅ Mesuré
63Sentence Transformers: all-MiniLM-L12-v2Sentence Transformers🟢 Ouvert18,5 %18 novembre 2025✅ Mesuré
64Mihaiii/gte-microMihaiii🟢 Ouvert18,5 %21 avril 2024✅ Mesuré
65minishlab/potion-base-2Mminishlab🟢 Ouvert18,4 %29 octobre 2024✅ Mesuré
66dwzhu/e5-base-4kdwzhu🟢 Ouvert18,2 %28 mars 2024✅ Mesuré
67Snowflake/snowflake-arctic-embed-m-v1.5Snowflake🟢 Ouvert17,3 %8 juillet 2024✅ Mesuré
68deepfile/embedder-100pdeepfile🟢 Ouvert17,0 %24 juillet 2023✅ Mesuré
69Snowflake/snowflake-arctic-embed-sSnowflake🟢 Ouvert16,5 %12 avril 2024✅ Mesuré
70intfloat/e5-small-v2Intfloat🟢 Ouvert16,2 %8 février 2024✅ Mesuré
71Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert16,2 %17 novembre 2025✅ Mesuré
72brahmairesearch/slx-v0.1brahmairesearch🟢 Ouvert16,1 %13 août 2024✅ Mesuré
73Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert16,1 %17 novembre 2025✅ Mesuré
74Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert16,0 %15 juin 2024✅ Mesuré
75ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert15,6 %18 décembre 2024✅ Mesuré
76intfloat/e5-smallIntfloat🟢 Ouvert15,4 %8 février 2024✅ Mesuré
77avsolatorio/GIST-all-MiniLM-L6-v2avsolatorio🟢 Ouvert15,2 %3 février 2024✅ Mesuré
78Snowflake/snowflake-arctic-embed-xsSnowflake🟢 Ouvert14,5 %8 juillet 2024✅ Mesuré
79sdadas/mmlw-e5-smallsdadas🟢 Ouvert13,5 %17 novembre 2023✅ Mesuré
80sdadas/mmlw-e5-basesdadas🟢 Ouvert12,9 %17 novembre 2023✅ Mesuré
81consciousAI/cai-lunaris-text-embeddingsconsciousAI🟢 Ouvert12,6 %22 juin 2023✅ Mesuré
82deepvk/deberta-v1-basedeepvk🟢 Ouvert11,8 %7 février 2023✅ Mesuré
83ai-forever/ru-en-RoSBERTaai-forever🟢 Ouvert10,2 %29 juillet 2024✅ Mesuré
84deepvk/USER-basedeepvk🟢 Ouvert8,6 %10 juin 2024✅ Mesuré
85jinaai/jina-embedding-s-en-v1Jina AI🟢 Ouvert7,8 %7 juillet 2023✅ Mesuré
86jinaai/jina-embedding-b-en-v1Jina AI🟢 Ouvert6,6 %7 juillet 2023✅ Mesuré
87sdadas/mmlw-roberta-basesdadas🟢 Ouvert6,4 %17 novembre 2023✅ Mesuré
88DeepPavlov/rubert-base-casedDeepPavlov🟢 Ouvert6,1 %4 mars 2020✅ Mesuré
89sdadas/mmlw-roberta-largesdadas🟢 Ouvert6,0 %17 novembre 2023✅ Mesuré
90DeepPavlov/rubert-base-cased-sentenceDeepPavlov🟢 Ouvert5,5 %4 mars 2020✅ Mesuré
91sergeyzh/rubert-tiny-turbosergeyzh🟢 Ouvert4,0 %21 juin 2024✅ Mesuré
92aari1995/German_Semantic_STS_V2aari1995🟢 Ouvert3,8 %17 novembre 2022✅ Mesuré
93DeepPavlov/distilrubert-small-cased-conversationalDeepPavlov🟢 Ouvert3,8 %28 juin 2022✅ Mesuré
94Omartificial-Intelligence-Space/Arabert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert3,7 %16 juin 2024✅ Mesuré
95cointegrated/rubert-tiny2cointegrated🟢 Ouvert3,6 %28 octobre 2021✅ Mesuré
96cointegrated/rubert-tinycointegrated🟢 Ouvert3,5 %24 mai 2021✅ Mesuré
97cointegrated/LaBSE-en-rucointegrated🟢 Ouvert3,5 %10 juin 2021✅ Mesuré
98Omartificial-Intelligence-Space/Marbert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert3,1 %17 juin 2024✅ Mesuré
99sergeyzh/LaBSE-ru-turbosergeyzh🟢 Ouvert3,0 %27 juin 2024✅ Mesuré
100silma-ai/silma-embeddding-matryoshka-v0.1silma-ai🟢 Ouvert2,8 %12 octobre 2024✅ Mesuré
101ai-forever/sbert_large_nlu_ruai-forever🟢 Ouvert2,3 %20 novembre 2020✅ Mesuré
102minishlab/M2V_base_gloveminishlab🟢 Ouvert0,3 %21 septembre 2024✅ Mesuré

Classement établi sur 102 modèles évalués. Score médian de l'ensemble : 20,6 %.

Notre analyse

Un score élevé indique qu’un modèle produit des plongements efficaces sur l’ensemble des tâches coréennes couvertes, selon des mesures comme nDCG@10, l’accuracy ou la corrélation de Spearman. Le classement fait apparaître une forte dispersion : avec une médiane de 21 % parmi 101 modèles et un meilleur résultat de 77 % pour SamilPwC-AXNode-GenAI/PwC-Embedding_expr, il ne semble pas globalement saturé. Il révèle aussi qu’une minorité de modèles se détache nettement du niveau central observé dans la base.

La lecture doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante. Cette modalité réduit l’homogénéité de la vérification et un score agrégé ne permet pas, à lui seul, de distinguer une capacité générale d’un éventuel effet de contamination. La portée demeure par ailleurs ciblée : MTEB: Korean mesure des embeddings en coréen sur quatre familles de tâches. Il ne constitue donc pas une évaluation générale de toutes les capacités d’un modèle.


Sources des scores : mteb.