Russian

MTEB: Russian est un benchmark public consacré à la qualité des embeddings textuels en russe. Créé par MTEB / MMTEB à partir de ruMTEB, il regroupe des jeux de données couvrant plusieurs usages, de la classification à la recherche d’information, en passant par le clustering et la…

MTEB: Russian est un benchmark public consacré à la qualité des embeddings textuels en russe. Créé par MTEB / MMTEB à partir de ruMTEB, il regroupe des jeux de données couvrant plusieurs usages, de la classification à la recherche d’information, en passant par le clustering et la similarité sémantique.

Son rôle est de comparer la capacité des modèles à produire des représentations pertinentes pour différentes tâches. Les résultats reposent sur des métriques adaptées à chaque cas, notamment nDCG@10, l’accuracy ou la corrélation de Spearman.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / MMTEB (embeddings-benchmark) ; base ruMTEB
Capacités mesuréesQualite des embeddings textuels en russe sur classification, clustering, reranking, pair classification, retrieval et similarite semantique.
ModalitéTexte
Type de questionsClassification, clustering, reranking, pair classification, retrieval, similarite semantique (STS)
Métrique d'évaluationVariable selon la tache (nDCG@10, accuracy, correlation Spearman, etc.)
AccèsPublic
LanguesRusse
Taille du jeuAgregat de jeux de donnees russes (ruMTEB ~23 jeux)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (104)

#ModèleÉditeurLicenceScoreSortieFiabilité
1ai-sage/Giga-Embeddings-instructai-sage🟢 Ouvert74,2 %23 septembre 2025✅ Mesuré
2Qwen: Qwen3 Embedding 8BAlibaba Cloud / Qwen Team🟢 Ouvert71,4 %28 octobre 2025✅ Mesuré
3ai-forever/FRIDAai-forever🟢 Ouvert71,0 %29 décembre 2024✅ Mesuré
4codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert70,9 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert70,6 %9 mars 2026✅ Mesuré
6Qwen: Qwen3 Embedding 4BAlibaba Cloud / Qwen Team🟢 Ouvert70,1 %28 octobre 2025✅ Mesuré
7codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert69,5 %9 mars 2026✅ Mesuré
8sergeyzh/BERTAsergeyzh🟢 Ouvert69,4 %10 mars 2025✅ Mesuré
9codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert68,5 %9 mars 2026✅ Mesuré
10intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert67,0 %8 février 2024✅ Mesuré
11codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert66,0 %9 mars 2026✅ Mesuré
12google/embeddinggemma-300mGoogle🟢 Ouvert65,2 %4 septembre 2025✅ Mesuré
13GritLM/GritLM-7BGritLM🟢 Ouvert65,0 %15 février 2024✅ Mesuré
14Qwen: Qwen3 Embedding 0.6BAlibaba Cloud / Qwen Team🟢 Ouvert64,3 %5 novembre 2025✅ Mesuré
15codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert63,9 %9 mars 2026✅ Mesuré
16jinaai/jina-embeddings-v3Jina AI🟢 Ouvert63,6 %18 septembre 2024✅ Mesuré
17sergeyzh/rubert-mini-fridasergeyzh🟢 Ouvert63,2 %2 mars 2025✅ Mesuré
18NovaSearch/stella_en_1.5B_v5NovaSearch🟢 Ouvert63,1 %12 juillet 2024✅ Mesuré
19deepvk/USER-bge-m3deepvk🟢 Ouvert62,9 %5 juillet 2024✅ Mesuré
20intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert62,4 %8 février 2024✅ Mesuré
21ai-forever/ru-en-RoSBERTaai-forever🟢 Ouvert61,8 %29 juillet 2024✅ Mesuré
22BAAI: bge-m3BAAI🟢 Ouvert61,6 %18 novembre 2025✅ Mesuré
23HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1.5HIT-TMG🟢 Ouvert61,5 %26 décembre 2024✅ Mesuré
24deepvk/USER2-basedeepvk🟢 Ouvert61,2 %19 avril 2025✅ Mesuré
25OrdalieTech/Solon-embeddings-large-0.1OrdalieTech🟢 Ouvert60,3 %9 décembre 2023✅ Mesuré
26HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1HIT-TMG🟢 Ouvert60,0 %23 octobre 2024✅ Mesuré
27codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert59,7 %9 mars 2026✅ Mesuré
28Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert59,7 %4 décembre 2024✅ Mesuré
29sergeyzh/LaBSE-ru-turbosergeyzh🟢 Ouvert59,4 %27 juin 2024✅ Mesuré
30deepvk/USER2-smalldeepvk🟢 Ouvert58,5 %19 avril 2025✅ Mesuré
31intfloat/multilingual-e5-baseIntfloat🟢 Ouvert58,4 %8 février 2024✅ Mesuré
32deepvk/USER-basedeepvk🟢 Ouvert58,3 %10 juin 2024✅ Mesuré
33Lajavaness/bilingual-embedding-baseLajavaness🟢 Ouvert58,2 %26 juin 2024✅ Mesuré
34intfloat/multilingual-e5-smallIntfloat🟢 Ouvert57,3 %8 février 2024✅ Mesuré
35codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert57,2 %9 mars 2026✅ Mesuré
36Lajavaness/bilingual-embedding-smallLajavaness🟢 Ouvert56,4 %17 juillet 2024✅ Mesuré
37ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert54,4 %18 décembre 2024✅ Mesuré
38sergeyzh/rubert-tiny-turbosergeyzh🟢 Ouvert53,8 %21 juin 2024✅ Mesuré
39sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert53,2 %1 novembre 2019✅ Mesuré
40Omartificial-Intelligence-Space/Arabic-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert52,8 %14 juin 2024✅ Mesuré
41ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert51,6 %18 décembre 2024✅ Mesuré
42Omartificial-Intelligence-Space/Arabic-labse-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert51,4 %16 juin 2024✅ Mesuré
43BorisTM/starseBorisTM🟢 Ouvert51,2 %25 juin 2026✅ Mesuré
44sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert49,7 %1 novembre 2019✅ Mesuré
45ai-forever/sbert_large_mt_nlu_ruai-forever🟢 Ouvert49,1 %18 mai 2021✅ Mesuré
46sentence-transformers/LaBSESentence Transformers🟢 Ouvert49,1 %1 novembre 2019✅ Mesuré
47Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert48,6 %25 juin 2024✅ Mesuré
48cointegrated/LaBSE-en-rucointegrated🟢 Ouvert48,6 %10 juin 2021✅ Mesuré
49ai-forever/sbert_large_nlu_ruai-forever🟢 Ouvert45,7 %20 novembre 2020✅ Mesuré
50cointegrated/rubert-tiny2cointegrated🟢 Ouvert42,7 %28 octobre 2021✅ Mesuré
51deepvk/deberta-v1-basedeepvk🟢 Ouvert42,6 %7 février 2023✅ Mesuré
52DeepPavlov/rubert-base-cased-sentenceDeepPavlov🟢 Ouvert42,2 %4 mars 2020✅ Mesuré
53DeepPavlov/distilrubert-small-cased-conversationalDeepPavlov🟢 Ouvert42,1 %28 juin 2022✅ Mesuré
54sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert41,4 %15 janvier 2025✅ Mesuré
55DeepPavlov/rubert-base-casedDeepPavlov🟢 Ouvert37,7 %4 mars 2020✅ Mesuré
56cointegrated/rubert-tinycointegrated🟢 Ouvert35,2 %24 mai 2021✅ Mesuré
57Intfloat: E5-Large-v2Intfloat🟢 Ouvert34,3 %18 novembre 2025✅ Mesuré
58BAAI: bge-large-en-v1.5BAAI🟢 Ouvert32,3 %18 novembre 2025✅ Mesuré
59WhereIsAI/UAE-Large-V1WhereIsAI🟢 Ouvert32,2 %4 décembre 2023✅ Mesuré
60mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert32,0 %7 mars 2024✅ Mesuré
61Intfloat: E5-Base-v2Intfloat🟢 Ouvert31,6 %18 novembre 2025✅ Mesuré
62avsolatorio/GIST-large-Embedding-v0avsolatorio🟢 Ouvert31,1 %14 février 2024✅ Mesuré
63nomic-ai/nomic-embed-text-v1-unsupervisedNomic AI🟢 Ouvert30,5 %15 janvier 2024✅ Mesuré
64BAAI: bge-base-en-v1.5BAAI🟢 Ouvert29,6 %18 novembre 2025✅ Mesuré
65nomic-ai/nomic-embed-text-v1Nomic AI🟢 Ouvert29,0 %31 janvier 2024✅ Mesuré
66avsolatorio/GIST-Embedding-v0avsolatorio🟢 Ouvert28,7 %31 janvier 2024✅ Mesuré
67nomic-ai/nomic-embed-text-v1.5Nomic AI🟢 Ouvert28,6 %10 février 2024✅ Mesuré
68deepfile/embedder-100pdeepfile🟢 Ouvert28,0 %24 juillet 2023✅ Mesuré
69dwzhu/e5-base-4kdwzhu🟢 Ouvert27,7 %28 mars 2024✅ Mesuré
70sdadas/mmlw-e5-smallsdadas🟢 Ouvert27,5 %17 novembre 2023✅ Mesuré
71infgrad/stella-base-en-v2infgrad🟢 Ouvert27,1 %19 octobre 2023✅ Mesuré
72BAAI/bge-small-en-v1.5BAAI🟢 Ouvert26,7 %12 septembre 2023✅ Mesuré
73sdadas/mmlw-e5-basesdadas🟢 Ouvert26,6 %17 novembre 2023✅ Mesuré
74intfloat/e5-small-v2Intfloat🟢 Ouvert26,4 %8 février 2024✅ Mesuré
75avsolatorio/GIST-small-Embedding-v0avsolatorio🟢 Ouvert26,3 %3 février 2024✅ Mesuré
76thenlper/gte-smallAlibaba🟢 Ouvert26,2 %27 juillet 2023✅ Mesuré
77ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert26,2 %18 décembre 2024✅ Mesuré
78abhinand/MedEmbed-small-v0.1abhinand🟢 Ouvert26,1 %20 octobre 2024✅ Mesuré
79Mihaiii/IvysaurMihaiii🟢 Ouvert25,7 %27 avril 2024✅ Mesuré
80intfloat/e5-largeIntfloat🟢 Ouvert25,5 %26 décembre 2022✅ Mesuré
81Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert25,4 %15 juin 2024✅ Mesuré
82Snowflake/snowflake-arctic-embed-mSnowflake🟢 Ouvert24,4 %12 avril 2024✅ Mesuré
83ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert24,0 %18 décembre 2024✅ Mesuré
84brahmairesearch/slx-v0.1brahmairesearch🟢 Ouvert23,7 %13 août 2024✅ Mesuré
85Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert23,7 %17 novembre 2025✅ Mesuré
86avsolatorio/GIST-all-MiniLM-L6-v2avsolatorio🟢 Ouvert23,6 %3 février 2024✅ Mesuré
87Mihaiii/SquirtleMihaiii🟢 Ouvert23,2 %30 avril 2024✅ Mesuré
88Mihaiii/WartortleMihaiii🟢 Ouvert23,0 %30 avril 2024✅ Mesuré
89intfloat/e5-baseIntfloat🟢 Ouvert22,9 %26 décembre 2022✅ Mesuré
90Mihaiii/VenusaurMihaiii🟢 Ouvert22,8 %29 avril 2024✅ Mesuré
91Mihaiii/BulbasaurMihaiii🟢 Ouvert22,8 %27 avril 2024✅ Mesuré
92Snowflake/snowflake-arctic-embed-m-v1.5Snowflake🟢 Ouvert22,4 %8 juillet 2024✅ Mesuré
93Mihaiii/gte-micro-v4Mihaiii🟢 Ouvert22,3 %22 avril 2024✅ Mesuré
94consciousAI/cai-lunaris-text-embeddingsconsciousAI🟢 Ouvert21,0 %22 juin 2023✅ Mesuré
95Snowflake/snowflake-arctic-embed-xsSnowflake🟢 Ouvert21,0 %8 juillet 2024✅ Mesuré
96intfloat/e5-smallIntfloat🟢 Ouvert20,8 %8 février 2024✅ Mesuré
97Snowflake/snowflake-arctic-embed-sSnowflake🟢 Ouvert20,6 %12 avril 2024✅ Mesuré
98Mihaiii/gte-microMihaiii🟢 Ouvert20,6 %21 avril 2024✅ Mesuré
99sdadas/mmlw-roberta-largesdadas🟢 Ouvert18,9 %17 novembre 2023✅ Mesuré
100aari1995/German_Semantic_STS_V2aari1995🟢 Ouvert18,4 %17 novembre 2022✅ Mesuré
101silma-ai/silma-embeddding-matryoshka-v0.1silma-ai🟢 Ouvert18,4 %12 octobre 2024✅ Mesuré
102Omartificial-Intelligence-Space/Marbert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert18,3 %17 juin 2024✅ Mesuré
103Omartificial-Intelligence-Space/Arabert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert18,2 %16 juin 2024✅ Mesuré
104sdadas/mmlw-roberta-basesdadas🟢 Ouvert17,5 %17 novembre 2023✅ Mesuré

Classement établi sur 104 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 42,2 %.

Notre analyse

Un score élevé sur MTEB: Russian traduit une bonne qualité globale des embeddings russes dans les différentes familles de tâches couvertes. Il ne correspond toutefois pas à une compétence unique, puisque l’agrégat combine des évaluations et des métriques distinctes. La portée du classement reste donc centrée sur le russe et sur les usages représentés par ruMTEB. La version 1.1 a remplacé MIRACLRetrieval et RiaNewsRetrieval par leurs variantes HardNegatives v2, dotées de prompts par défaut améliorés, ce qui rend la version du benchmark importante pour interpréter les comparaisons.

Parmi les 103 modèles de la base, ai-sage/Giga-Embeddings-instruct atteint 74 %, contre un score médian de 42 %. Cet écart révèle une forte différenciation entre le modèle de tête et le niveau central du classement, sans signe de saturation complète au sommet. La rigueur comparative doit néanmoins être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que tous mesurés dans un protocole indépendant et homogène. Le classement constitue ainsi un indicateur comparatif utile, mais dépend de la cohérence des déclarations et des conditions d’évaluation appliquées.


Sources des scores : mteb.