Japanese
MTEB: Japanese est un benchmark créé par SB Intuitions pour évaluer la qualité des plongements de texte en japonais. Il couvre plusieurs usages complémentaires, notamment le clustering, la classification, la similarité sémantique, la recherche d’information et le reranking.
MTEB: Japanese est un benchmark créé par SB Intuitions pour évaluer la qualité des plongements de texte en japonais. Il couvre plusieurs usages complémentaires, notamment le clustering, la classification, la similarité sémantique, la recherche d’information et le reranking.
Publié en 2025, il sert à comparer les capacités de représentation textuelle des modèles sur un ensemble diversifié de tâches. Sa version v2 étend l’évaluation à 28 jeux de données, afin de proposer une mesure plus complète que MTEB(jpn, v1).
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | SB Intuitions |
| Capacités mesurées | Evalue la qualite des plongements de texte en japonais sur le clustering, la classification, la similarite semantique, la recherche et le reranking. |
| Modalité | Texte |
| Type de questions | Taches d'embedding de texte (clustering, classification, similarite semantique, retrieval, reranking) |
| Métrique d'évaluation | Variable selon la tache (nDCG@10, accuracy, correlation de Spearman) ; score moyen JMTEB |
| Accès | Public |
| Langues | Japonais |
| Taille du jeu | 28 jeux de donnees (version v2) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (20)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 79,3 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 78,5 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 77,4 % | 9 mars 2026 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 75,7 % | 9 mars 2026 | ✅ Mesuré |
| 5 | sbintuitions/sarashina-embedding-v2-1b | sbintuitions | 🟢 Ouvert | 73,2 % | 30 juillet 2025 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 73,1 % | 9 mars 2026 | ✅ Mesuré |
| 7 | microsoft/harrier-oss-v1-0.6b | Microsoft | 🟢 Ouvert | 72,7 % | 27 mars 2026 | ✅ Mesuré |
| 8 | cl-nagoya/ruri-v3-310m | cl-nagoya | 🟢 Ouvert | 72,4 % | 9 avril 2025 | ✅ Mesuré |
| 9 | cl-nagoya/ruri-v3-130m | cl-nagoya | 🟢 Ouvert | 71,9 % | 9 avril 2025 | ✅ Mesuré |
| 10 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 70,8 % | 9 mars 2026 | ✅ Mesuré |
| 11 | cl-nagoya/ruri-v3-70m | cl-nagoya | 🟢 Ouvert | 70,6 % | 9 avril 2025 | ✅ Mesuré |
| 12 | sbintuitions/sarashina-embedding-v1-1b | sbintuitions | 🟢 Ouvert | 69,5 % | 22 novembre 2024 | ✅ Mesuré |
| 13 | cl-nagoya/ruri-large-v2 | cl-nagoya | 🟢 Ouvert | 69,5 % | 6 décembre 2024 | ✅ Mesuré |
| 14 | cl-nagoya/ruri-v3-30m | cl-nagoya | 🟢 Ouvert | 69,4 % | 7 avril 2025 | ✅ Mesuré |
| 15 | microsoft/harrier-oss-v1-270m | Microsoft | 🟢 Ouvert | 69,3 % | 27 mars 2026 | ✅ Mesuré |
| 16 | cl-nagoya/ruri-base-v2 | cl-nagoya | 🟢 Ouvert | 68,3 % | 5 décembre 2024 | ✅ Mesuré |
| 17 | cl-nagoya/ruri-large | cl-nagoya | 🟢 Ouvert | 67,5 % | 28 août 2024 | ✅ Mesuré |
| 18 | cl-nagoya/ruri-base | cl-nagoya | 🟢 Ouvert | 66,0 % | 28 août 2024 | ✅ Mesuré |
| 19 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 65,7 % | 9 mars 2026 | ✅ Mesuré |
| 20 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 58,8 % | 9 mars 2026 | ✅ Mesuré |
Classement établi sur 20 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 70,7 %.
Notre analyse
Un score moyen JMTEB élevé indique qu’un modèle produit des plongements efficaces sur plusieurs familles de tâches en japonais. Cette synthèse agrège toutefois des métriques variables selon les épreuves, comme nDCG@10, l’accuracy ou la corrélation de Spearman. Le score global doit donc être interprété comme une performance transversale, et non comme une garantie uniforme sur chaque usage.
Dans la base, 21 modèles atteignent un score médian de 71 %. codefuse-ai/F2LLM-v2-14B arrive en tête à 79 %, soit huit points au-dessus de cette médiane. Cet écart montre une différenciation encore visible entre le meilleur résultat et le centre du classement, sans signaler une saturation complète. La portée reste circonscrite aux plongements de texte en japonais et aux cinq catégories évaluées par les 28 jeux de données de la version v2.
La fiabilité appelle néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Le classement constitue donc un indicateur comparatif utile, mais sa lecture dépend de la rigueur et de l’homogénéité des évaluations rapportées.
Sources des scores : mteb.