Indic

MTEB: Indic est un benchmark public consacré à la qualité des embeddings de texte dans les langues indiennes. Publié en 2025 par MTEB / MMTEB, dans le cadre d’embeddings-benchmark et des travaux de Kenneth Enevoldsen et al., il couvre plusieurs formes d’évaluation multilingue.

MTEB: Indic est un benchmark public consacré à la qualité des embeddings de texte dans les langues indiennes. Publié en 2025 par MTEB / MMTEB, dans le cadre d’embeddings-benchmark et des travaux de Kenneth Enevoldsen et al., il couvre plusieurs formes d’évaluation multilingue.

Il mesure la capacité des modèles à représenter et rapprocher des textes pour le bitext mining, la classification, le clustering, la pair classification, le retrieval, le reranking et la similarité sémantique. Il sert ainsi à comparer les performances des modèles sur un ensemble diversifié de tâches liées aux embeddings.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / MMTEB (embeddings-benchmark, Kenneth Enevoldsen et al.)
Capacités mesuréesQualité des embeddings de texte à travers les langues indiennes : bitext mining, classification, clustering, pair classification, retrieval, reranking et similarité sémantique.
ModalitéTexte
Type de questionsÉvaluation d'embeddings de texte multilingues (bitext mining, classification, clustering, pair classification, retrieval, reranking, STS)
Métrique d'évaluationScore dépendant de la tâche (nDCG@10, accuracy, V-measure, Spearman), agrégé
AccèsPublic
LanguesLangues indiennes (indic)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (118)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert78,8 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert77,9 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert76,6 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert74,2 %9 mars 2026✅ Mesuré
5LingoIITGN/qwen-indic-v1LingoIITGN🟢 Ouvert73,8 %3 juillet 2026✅ Mesuré
6intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert70,2 %8 février 2024✅ Mesuré
7codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert70,1 %9 mars 2026✅ Mesuré
8Alibaba-NLP/gte-Qwen2-7B-instructAlibaba🟢 Ouvert69,4 %15 juin 2024✅ Mesuré
9Cohere/Cohere-embed-multilingual-v3.0Cohere🟢 Ouvert68,7 %2 novembre 2023✅ Mesuré
10OrdalieTech/Solon-embeddings-large-0.1OrdalieTech🟢 Ouvert68,4 %9 décembre 2023✅ Mesuré
11Lajavaness/bilingual-embedding-largeLajavaness🟢 Ouvert67,4 %24 juin 2024✅ Mesuré
12codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert66,9 %9 mars 2026✅ Mesuré
13Lajavaness/bilingual-embedding-baseLajavaness🟢 Ouvert66,6 %26 juin 2024✅ Mesuré
14Cohere/Cohere-embed-multilingual-light-v3.0Cohere🟢 Ouvert66,1 %2 novembre 2023✅ Mesuré
15Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert65,9 %4 décembre 2024✅ Mesuré
16Lajavaness/bilingual-embedding-smallLajavaness🟢 Ouvert65,0 %17 juillet 2024✅ Mesuré
17intfloat/multilingual-e5-baseIntfloat🟢 Ouvert64,6 %8 février 2024✅ Mesuré
18omarelshehy/arabic-english-sts-matryoshkaomarelshehy🟢 Ouvert63,6 %13 octobre 2024✅ Mesuré
19voyageai/voyage-3-liteVoyage AI🟢 Ouvert63,2 %18 septembre 2024✅ Mesuré
20Omartificial-Intelligence-Space/Arabic-labse-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert63,0 %16 juin 2024✅ Mesuré
21codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert62,1 %9 mars 2026✅ Mesuré
22Linq-AI-Research/Linq-Embed-MistralLinq-AI-Research🟢 Ouvert61,9 %29 mai 2024✅ Mesuré
23sentence-transformers/LaBSESentence Transformers🟢 Ouvert61,7 %1 novembre 2019✅ Mesuré
24Alibaba-NLP/gte-Qwen2-1.5B-instructAlibaba🟢 Ouvert60,4 %29 juillet 2024✅ Mesuré
25GritLM/GritLM-7BGritLM🟢 Ouvert60,2 %15 février 2024✅ Mesuré
26ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert60,0 %18 décembre 2024✅ Mesuré
27intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert60,0 %8 février 2024✅ Mesuré
28Salesforce/SFR-Embedding-2_RSalesforce🟢 Ouvert59,8 %14 juin 2024✅ Mesuré
29Alibaba-NLP/gte-Qwen1.5-7B-instructAlibaba🟢 Ouvert59,6 %20 avril 2024✅ Mesuré
30Salesforce/SFR-Embedding-MistralSalesforce🟢 Ouvert59,4 %24 janvier 2024✅ Mesuré
31Snowflake/snowflake-arctic-embed-m-v2.0Snowflake🟢 Ouvert59,4 %4 décembre 2024✅ Mesuré
32Omartificial-Intelligence-Space/Arabic-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert59,0 %14 juin 2024✅ Mesuré
33HIT-TMG/KaLM-embedding-multilingual-mini-v1HIT-TMG🟢 Ouvert58,6 %27 août 2024✅ Mesuré
34sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert58,5 %1 novembre 2019✅ Mesuré
35codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert58,4 %9 mars 2026✅ Mesuré
36Gameselo/STS-multilingual-mpnet-base-v2Gameselo🟢 Ouvert57,8 %7 juin 2024✅ Mesuré
37HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1HIT-TMG🟢 Ouvert57,2 %23 octobre 2024✅ Mesuré
38ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert56,8 %18 décembre 2024✅ Mesuré
39nvidia/NV-Embed-v2NVIDIA🟢 Ouvert56,3 %9 septembre 2024✅ Mesuré
40Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert54,3 %25 juin 2024✅ Mesuré
41nvidia/NV-Embed-v1NVIDIA🟢 Ouvert52,8 %13 septembre 2024✅ Mesuré
42NovaSearch/stella_en_1.5B_v5NovaSearch🟢 Ouvert52,3 %12 juillet 2024✅ Mesuré
43minishlab/potion-multilingual-128Mminishlab🟢 Ouvert51,6 %23 mai 2025✅ Mesuré
44sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert49,8 %1 novembre 2019✅ Mesuré
45Haon-Chen/speed-embedding-7b-instructHaon-Chen🟢 Ouvert47,5 %31 octobre 2024✅ Mesuré
46Sailesh97/HinvecSailesh97🟢 Ouvert46,9 %19 juin 2025✅ Mesuré
47izhx/udever-bloom-3bizhx🟢 Ouvert46,8 %24 octobre 2023✅ Mesuré
48bigscience/sgpt-bloom-7b1-msmarcobigscience🟢 Ouvert46,2 %26 août 2022✅ Mesuré
49izhx/udever-bloom-7b1izhx🟢 Ouvert45,6 %24 octobre 2023✅ Mesuré
50sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert44,3 %15 janvier 2025✅ Mesuré
51Jaume/gemma-2b-embeddingsJaume🟢 Ouvert44,3 %29 juin 2024✅ Mesuré
52deepfile/embedder-100pdeepfile🟢 Ouvert43,6 %24 juillet 2023✅ Mesuré
53Cohere/Cohere-embed-english-v3.0Cohere🟢 Ouvert37,2 %2 novembre 2023✅ Mesuré
54NovaSearch/stella_en_400M_v5NovaSearch🟢 Ouvert37,1 %12 juillet 2024✅ Mesuré
55sdadas/mmlw-e5-basesdadas🟢 Ouvert36,9 %17 novembre 2023✅ Mesuré
56Intfloat: E5-Large-v2Intfloat🟢 Ouvert36,8 %18 novembre 2025✅ Mesuré
57manu/sentence_croissant_alpha_v0.2manu🟢 Ouvert36,6 %15 mars 2024✅ Mesuré
58sdadas/mmlw-e5-largesdadas🟢 Ouvert36,6 %17 novembre 2023✅ Mesuré
59Intfloat: E5-Base-v2Intfloat🟢 Ouvert36,3 %18 novembre 2025✅ Mesuré
60manu/sentence_croissant_alpha_v0.3manu🟢 Ouvert36,3 %26 avril 2024✅ Mesuré
61nomic-ai/nomic-embed-text-v1-unsupervisedNomic AI🟢 Ouvert36,3 %15 janvier 2024✅ Mesuré
62manu/sentence_croissant_alpha_v0.4manu🟢 Ouvert36,2 %27 avril 2024✅ Mesuré
63nomic-ai/nomic-embed-text-v1Nomic AI🟢 Ouvert36,2 %31 janvier 2024✅ Mesuré
64sdadas/mmlw-e5-smallsdadas🟢 Ouvert36,2 %17 novembre 2023✅ Mesuré
65nomic-ai/nomic-embed-text-v1.5Nomic AI🟢 Ouvert35,6 %10 février 2024✅ Mesuré
66Cohere/Cohere-embed-english-light-v3.0Cohere🟢 Ouvert35,0 %2 novembre 2023✅ Mesuré
67dwzhu/e5-base-4kdwzhu🟢 Ouvert34,6 %28 mars 2024✅ Mesuré
68Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert34,5 %15 juin 2024✅ Mesuré
69intfloat/e5-small-v2Intfloat🟢 Ouvert34,2 %8 février 2024✅ Mesuré
70ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert34,2 %18 décembre 2024✅ Mesuré
71Snowflake/snowflake-arctic-embed-m-v1.5Snowflake🟢 Ouvert34,1 %8 juillet 2024✅ Mesuré
72avsolatorio/GIST-large-Embedding-v0avsolatorio🟢 Ouvert34,0 %14 février 2024✅ Mesuré
73infgrad/stella-base-en-v2infgrad🟢 Ouvert33,9 %19 octobre 2023✅ Mesuré
74BAAI: bge-base-en-v1.5BAAI🟢 Ouvert33,9 %18 novembre 2025✅ Mesuré
75Snowflake/snowflake-arctic-embed-mSnowflake🟢 Ouvert33,6 %12 avril 2024✅ Mesuré
76WhereIsAI/UAE-Large-V1WhereIsAI🟢 Ouvert33,5 %4 décembre 2023✅ Mesuré
77intfloat/e5-largeIntfloat🟢 Ouvert33,4 %26 décembre 2022✅ Mesuré
78avsolatorio/GIST-Embedding-v0avsolatorio🟢 Ouvert33,3 %31 janvier 2024✅ Mesuré
79mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert33,3 %7 mars 2024✅ Mesuré
80Snowflake/snowflake-arctic-embed-lSnowflake🟢 Ouvert33,3 %12 avril 2024✅ Mesuré
81Snowflake/snowflake-arctic-embed-sSnowflake🟢 Ouvert33,0 %12 avril 2024✅ Mesuré
82minishlab/M2V_base_glove_subwordminishlab🟢 Ouvert33,0 %21 septembre 2024✅ Mesuré
83Mihaiii/IvysaurMihaiii🟢 Ouvert32,9 %27 avril 2024✅ Mesuré
84Snowflake/snowflake-arctic-embed-xsSnowflake🟢 Ouvert32,7 %8 juillet 2024✅ Mesuré
85minishlab/M2V_base_outputminishlab🟢 Ouvert32,7 %21 septembre 2024✅ Mesuré
86Mihaiii/VenusaurMihaiii🟢 Ouvert32,6 %29 avril 2024✅ Mesuré
87sdadas/mmlw-roberta-largesdadas🟢 Ouvert32,6 %17 novembre 2023✅ Mesuré
88avsolatorio/GIST-all-MiniLM-L6-v2avsolatorio🟢 Ouvert32,4 %3 février 2024✅ Mesuré
89minishlab/potion-base-8Mminishlab🟢 Ouvert32,2 %29 octobre 2024✅ Mesuré
90BAAI/bge-small-en-v1.5BAAI🟢 Ouvert32,1 %12 septembre 2023✅ Mesuré
91Mihaiii/SquirtleMihaiii🟢 Ouvert32,1 %30 avril 2024✅ Mesuré
92Mihaiii/WartortleMihaiii🟢 Ouvert32,1 %30 avril 2024✅ Mesuré
93intfloat/e5-baseIntfloat🟢 Ouvert32,0 %26 décembre 2022✅ Mesuré
94minishlab/potion-base-4Mminishlab🟢 Ouvert32,0 %29 octobre 2024✅ Mesuré
95Thenlper: GTE-BaseAlibaba🟢 Ouvert32,0 %18 novembre 2025✅ Mesuré
96Mihaiii/BulbasaurMihaiii🟢 Ouvert31,9 %27 avril 2024✅ Mesuré
97abhinand/MedEmbed-small-v0.1abhinand🟢 Ouvert31,8 %20 octobre 2024✅ Mesuré
98Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert31,8 %17 novembre 2025✅ Mesuré
99brahmairesearch/slx-v0.1brahmairesearch🟢 Ouvert31,8 %13 août 2024✅ Mesuré
100BAAI: bge-large-en-v1.5BAAI🟢 Ouvert31,8 %18 novembre 2025✅ Mesuré
101Mihaiii/gte-micro-v4Mihaiii🟢 Ouvert31,8 %22 avril 2024✅ Mesuré
102intfloat/e5-smallIntfloat🟢 Ouvert31,7 %8 février 2024✅ Mesuré
103avsolatorio/GIST-small-Embedding-v0avsolatorio🟢 Ouvert31,6 %3 février 2024✅ Mesuré
104thenlper/gte-smallAlibaba🟢 Ouvert31,5 %27 juillet 2023✅ Mesuré
105minishlab/potion-base-2Mminishlab🟢 Ouvert31,4 %29 octobre 2024✅ Mesuré
106silma-ai/silma-embeddding-matryoshka-v0.1silma-ai🟢 Ouvert31,3 %12 octobre 2024✅ Mesuré
107Thenlper: GTE-LargeAlibaba🟢 Ouvert31,3 %18 novembre 2025✅ Mesuré
108ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert31,3 %18 décembre 2024✅ Mesuré
109consciousAI/cai-lunaris-text-embeddingsconsciousAI🟢 Ouvert31,2 %22 juin 2023✅ Mesuré
110aari1995/German_Semantic_STS_V2aari1995🟢 Ouvert31,2 %17 novembre 2022✅ Mesuré
111Omartificial-Intelligence-Space/Arabert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert31,2 %16 juin 2024✅ Mesuré
112sdadas/mmlw-roberta-basesdadas🟢 Ouvert31,0 %17 novembre 2023✅ Mesuré
113ai-forever/ru-en-RoSBERTaai-forever🟢 Ouvert30,6 %29 juillet 2024✅ Mesuré
114Mihaiii/gte-microMihaiii🟢 Ouvert30,3 %21 avril 2024✅ Mesuré
115Omartificial-Intelligence-Space/Marbert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert30,3 %17 juin 2024✅ Mesuré
116minishlab/M2V_base_gloveminishlab🟢 Ouvert28,9 %21 septembre 2024✅ Mesuré
117malenia1/ternary-weight-embeddingmalenia1🟢 Ouvert28,9 %23 octobre 2024✅ Mesuré
118jinaai/jina-embeddings-v2-base-enJina AI🟢 Ouvert28,9 %27 septembre 2023✅ Mesuré

Classement établi sur 118 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 36,3 %.

Notre analyse

Un score élevé sur MTEB: Indic traduit une bonne qualité globale des embeddings dans les langues indiennes et sur plusieurs usages, de la recherche d’information à la similarité sémantique. Son interprétation doit toutefois tenir compte de l’agrégation de métriques dépendant des tâches, notamment nDCG@10, accuracy, V-measure et Spearman. Une même valeur synthétise donc des aptitudes différentes et ne décrit pas à elle seule chaque composante du benchmark.

Dans la base, 118 modèles sont évalués. Le score médian de 36 %, comparé aux 79 % de codefuse-ai/F2LLM-v2-14B, fait apparaître un écart important entre le milieu du classement et son meilleur résultat. Cette dispersion ne suggère pas une saturation générale du benchmark et met en évidence une forte différenciation entre modèles. La portée demeure centrée sur les embeddings de texte, les langues indiennes et les sept familles de tâches couvertes.

La lecture du classement appelle enfin une prudence méthodologique, car les scores sont majoritairement auto-déclarés par les éditeurs. Ils ne relèvent donc pas tous d’une mesure indépendante et homogène. Le classement fournit une comparaison utile, mais sa rigueur dépend aussi de la cohérence des évaluations rapportées.


Sources des scores : mteb.