Japanese

MTEB: Japanese est un benchmark créé par SB Intuitions pour évaluer la qualité des plongements de texte en japonais. Il couvre plusieurs usages complémentaires, notamment le clustering, la classification, la similarité sémantique, la recherche d’information et le reranking.

MTEB: Japanese est un benchmark créé par SB Intuitions pour évaluer la qualité des plongements de texte en japonais. Il couvre plusieurs usages complémentaires, notamment le clustering, la classification, la similarité sémantique, la recherche d’information et le reranking.

Publié en 2025, il sert à comparer les capacités de représentation textuelle des modèles sur un ensemble diversifié de tâches. Sa version v2 étend l’évaluation à 28 jeux de données, afin de proposer une mesure plus complète que MTEB(jpn, v1).

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSB Intuitions
Capacités mesuréesEvalue la qualite des plongements de texte en japonais sur le clustering, la classification, la similarite semantique, la recherche et le reranking.
ModalitéTexte
Type de questionsTaches d'embedding de texte (clustering, classification, similarite semantique, retrieval, reranking)
Métrique d'évaluationVariable selon la tache (nDCG@10, accuracy, correlation de Spearman) ; score moyen JMTEB
AccèsPublic
LanguesJaponais
Taille du jeu28 jeux de donnees (version v2)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (20)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert79,3 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert78,5 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert77,4 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert75,7 %9 mars 2026✅ Mesuré
5sbintuitions/sarashina-embedding-v2-1bsbintuitions🟢 Ouvert73,2 %30 juillet 2025✅ Mesuré
6codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert73,1 %9 mars 2026✅ Mesuré
7microsoft/harrier-oss-v1-0.6bMicrosoft🟢 Ouvert72,7 %27 mars 2026✅ Mesuré
8cl-nagoya/ruri-v3-310mcl-nagoya🟢 Ouvert72,4 %9 avril 2025✅ Mesuré
9cl-nagoya/ruri-v3-130mcl-nagoya🟢 Ouvert71,9 %9 avril 2025✅ Mesuré
10codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert70,8 %9 mars 2026✅ Mesuré
11cl-nagoya/ruri-v3-70mcl-nagoya🟢 Ouvert70,6 %9 avril 2025✅ Mesuré
12sbintuitions/sarashina-embedding-v1-1bsbintuitions🟢 Ouvert69,5 %22 novembre 2024✅ Mesuré
13cl-nagoya/ruri-large-v2cl-nagoya🟢 Ouvert69,5 %6 décembre 2024✅ Mesuré
14cl-nagoya/ruri-v3-30mcl-nagoya🟢 Ouvert69,4 %7 avril 2025✅ Mesuré
15microsoft/harrier-oss-v1-270mMicrosoft🟢 Ouvert69,3 %27 mars 2026✅ Mesuré
16cl-nagoya/ruri-base-v2cl-nagoya🟢 Ouvert68,3 %5 décembre 2024✅ Mesuré
17cl-nagoya/ruri-largecl-nagoya🟢 Ouvert67,5 %28 août 2024✅ Mesuré
18cl-nagoya/ruri-basecl-nagoya🟢 Ouvert66,0 %28 août 2024✅ Mesuré
19codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert65,7 %9 mars 2026✅ Mesuré
20codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert58,8 %9 mars 2026✅ Mesuré

Classement établi sur 20 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 70,7 %.

Notre analyse

Un score moyen JMTEB élevé indique qu’un modèle produit des plongements efficaces sur plusieurs familles de tâches en japonais. Cette synthèse agrège toutefois des métriques variables selon les épreuves, comme nDCG@10, l’accuracy ou la corrélation de Spearman. Le score global doit donc être interprété comme une performance transversale, et non comme une garantie uniforme sur chaque usage.

Dans la base, 21 modèles atteignent un score médian de 71 %. codefuse-ai/F2LLM-v2-14B arrive en tête à 79 %, soit huit points au-dessus de cette médiane. Cet écart montre une différenciation encore visible entre le meilleur résultat et le centre du classement, sans signaler une saturation complète. La portée reste circonscrite aux plongements de texte en japonais et aux cinq catégories évaluées par les 28 jeux de données de la version v2.

La fiabilité appelle néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Le classement constitue donc un indicateur comparatif utile, mais sa lecture dépend de la rigueur et de l’homogénéité des évaluations rapportées.


Sources des scores : mteb.