Medical

MTEB: Medical est un benchmark public créé en 2025 par MTEB / MMTEB (embeddings-benchmark). Il évalue la recherche d’information médicale dans des contenus cliniques, biomédicaux et destinés au grand public.

MTEB: Medical est un benchmark public créé en 2025 par MTEB / MMTEB (embeddings-benchmark). Il évalue la recherche d’information médicale dans des contenus cliniques, biomédicaux et destinés au grand public.

Son agrégat de tâches couvre le retrieval, le reranking et le clustering, principalement sur des textes anglais, avec quelques autres langues. Il sert à comparer la capacité des modèles d’embeddings à retrouver, ordonner ou regrouper des informations médicales pertinentes dans plusieurs contextes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / MMTEB (embeddings-benchmark)
Capacités mesuréesRecherche d'information medicale a travers les domaines clinique, biomedical et sante grand public (retrieval, reranking, clustering).
ModalitéTexte
Type de questionsRecherche d'information, reranking et clustering sur textes medicaux
Métrique d'évaluationnDCG@10 et autres metriques selon la tache
AccèsPublic
LanguesPrincipalement anglais (avec quelques autres langues)
Taille du jeuAgregat de taches medicales (env. 12 jeux de donnees dans la section medicale de MTEB)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (158)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Alibaba-NLP/gte-Qwen2-7B-instructAlibaba🟢 Ouvert66,6 %15 juin 2024✅ Mesuré
2codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert65,2 %9 mars 2026✅ Mesuré
3Alibaba-NLP/gte-Qwen2-1.5B-instructAlibaba🟢 Ouvert65,0 %29 juillet 2024✅ Mesuré
4codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert64,9 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert64,5 %9 mars 2026✅ Mesuré
6ICT-TIME-and-Querit/BOOM_4B_v1ICT-TIME-and-Querit🟢 Ouvert64,5 %31 janvier 2026✅ Mesuré
7Salesforce/SFR-Embedding-MistralSalesforce🟢 Ouvert64,5 %24 janvier 2024✅ Mesuré
8Salesforce/SFR-Embedding-2_RSalesforce🟢 Ouvert64,3 %14 juin 2024✅ Mesuré
9ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1ICT-TIME-and-Querit🟢 Ouvert64,3 %2 mai 2026✅ Mesuré
10Linq-AI-Research/Linq-Embed-MistralLinq-AI-Research🟢 Ouvert63,9 %29 mai 2024✅ Mesuré
11nvidia/NV-Embed-v2NVIDIA🟢 Ouvert63,6 %9 septembre 2024✅ Mesuré
12nvidia/NV-Embed-v1NVIDIA🟢 Ouvert63,0 %13 septembre 2024✅ Mesuré
13intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert62,7 %8 février 2024✅ Mesuré
14Alibaba-NLP/gte-Qwen1.5-7B-instructAlibaba🟢 Ouvert62,2 %20 avril 2024✅ Mesuré
15voyageai/voyage-3Voyage AI🟢 Ouvert61,5 %18 septembre 2024✅ Mesuré
16GritLM/GritLM-7BGritLM🟢 Ouvert61,5 %15 février 2024✅ Mesuré
17codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert61,4 %9 mars 2026✅ Mesuré
18NovaSearch/jasper_en_vision_language_v1NovaSearch🟢 Ouvert61,2 %11 décembre 2024✅ Mesuré
19openai/text-embedding-3-largeOpenAI🟢 Ouvert61,0 %25 janvier 2024✅ Mesuré
20voyageai/voyage-multilingual-2Voyage AI🟢 Ouvert61,0 %10 juin 2024✅ Mesuré
21GritLM/GritLM-8x7BGritLM🟢 Ouvert60,9 %15 février 2024✅ Mesuré
22Cohere/Cohere-embed-multilingual-v3.0Cohere🟢 Ouvert60,8 %2 novembre 2023✅ Mesuré
23jinaai/jina-embeddings-v3Jina AI🟢 Ouvert59,5 %18 septembre 2024✅ Mesuré
24NovaSearch/stella_en_1.5B_v5NovaSearch🟢 Ouvert59,4 %12 juillet 2024✅ Mesuré
25Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert59,4 %4 décembre 2024✅ Mesuré
26intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert58,5 %8 février 2024✅ Mesuré
27codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert57,9 %9 mars 2026✅ Mesuré
28HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1HIT-TMG🟢 Ouvert57,3 %23 octobre 2024✅ Mesuré
29HIT-TMG/KaLM-embedding-multilingual-mini-v1HIT-TMG🟢 Ouvert57,3 %27 août 2024✅ Mesuré
30Snowflake/snowflake-arctic-embed-m-v2.0Snowflake🟢 Ouvert57,3 %4 décembre 2024✅ Mesuré
31Alibaba-NLP/gte-multilingual-baseAlibaba🟢 Ouvert57,0 %20 juillet 2024✅ Mesuré
32Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert56,6 %18 novembre 2025✅ Mesuré
33codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert56,4 %9 mars 2026✅ Mesuré
34Cohere/Cohere-embed-multilingual-light-v3.0Cohere🟢 Ouvert56,1 %2 novembre 2023✅ Mesuré
35openai/text-embedding-3-smallOpenAI🟢 Ouvert55,6 %25 janvier 2024✅ Mesuré
36voyageai/voyage-3-liteVoyage AI🟢 Ouvert55,4 %18 septembre 2024✅ Mesuré
37intfloat/multilingual-e5-baseIntfloat🟢 Ouvert54,3 %8 février 2024✅ Mesuré
38OrdalieTech/Solon-embeddings-large-0.1OrdalieTech🟢 Ouvert54,1 %9 décembre 2023✅ Mesuré
39BAAI: bge-m3BAAI🟢 Ouvert53,6 %18 novembre 2025✅ Mesuré
40Lajavaness/bilingual-embedding-largeLajavaness🟢 Ouvert53,5 %24 juin 2024✅ Mesuré
41intfloat/multilingual-e5-smallIntfloat🟢 Ouvert53,4 %8 février 2024✅ Mesuré
42codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert52,4 %9 mars 2026✅ Mesuré
43ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert50,9 %18 décembre 2024✅ Mesuré
44codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert50,7 %9 mars 2026✅ Mesuré
45Lajavaness/bilingual-embedding-baseLajavaness🟢 Ouvert50,6 %26 juin 2024✅ Mesuré
46manu/bge-m3-custom-frmanu🟢 Ouvert49,0 %11 avril 2024✅ Mesuré
47McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-supervisedMcGill-NLP🟢 Ouvert48,3 %9 avril 2024✅ Mesuré
48Haon-Chen/speed-embedding-7b-instructHaon-Chen🟢 Ouvert47,0 %31 octobre 2024✅ Mesuré
49ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert46,8 %18 décembre 2024✅ Mesuré
50Lajavaness/bilingual-embedding-smallLajavaness🟢 Ouvert46,7 %17 juillet 2024✅ Mesuré
51Cohere/Cohere-embed-english-v3.0Cohere🟢 Ouvert45,3 %2 novembre 2023✅ Mesuré
52nomic-ai/nomic-embed-text-v1-ablatedNomic AI🟢 Ouvert43,5 %15 janvier 2024✅ Mesuré
53NovaSearch/stella_en_400M_v5NovaSearch🟢 Ouvert43,5 %12 juillet 2024✅ Mesuré
54intfloat/e5-largeIntfloat🟢 Ouvert42,9 %26 décembre 2022✅ Mesuré
55deepvk/USER-bge-m3deepvk🟢 Ouvert42,9 %5 juillet 2024✅ Mesuré
56BAAI: bge-base-en-v1.5BAAI🟢 Ouvert42,9 %18 novembre 2025✅ Mesuré
57Snowflake/snowflake-arctic-embed-lSnowflake🟢 Ouvert42,3 %12 avril 2024✅ Mesuré
58Thenlper: GTE-LargeAlibaba🟢 Ouvert42,1 %18 novembre 2025✅ Mesuré
59BAAI: bge-large-en-v1.5BAAI🟢 Ouvert42,1 %18 novembre 2025✅ Mesuré
60WhereIsAI/UAE-Large-V1WhereIsAI🟢 Ouvert41,4 %4 décembre 2023✅ Mesuré
61Cohere/Cohere-embed-english-light-v3.0Cohere🟢 Ouvert41,4 %2 novembre 2023✅ Mesuré
62Intfloat: E5-Large-v2Intfloat🟢 Ouvert41,2 %18 novembre 2025✅ Mesuré
63mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert41,2 %7 mars 2024✅ Mesuré
64w601sxs/b1ade-embedw601sxs🟢 Ouvert41,2 %10 mars 2025✅ Mesuré
65sdadas/mmlw-e5-largesdadas🟢 Ouvert41,0 %17 novembre 2023✅ Mesuré
66nomic-ai/nomic-embed-text-v1-unsupervisedNomic AI🟢 Ouvert40,9 %15 janvier 2024✅ Mesuré
67ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert40,8 %18 décembre 2024✅ Mesuré
68Snowflake/snowflake-arctic-embed-mSnowflake🟢 Ouvert40,8 %12 avril 2024✅ Mesuré
69intfloat/e5-baseIntfloat🟢 Ouvert40,8 %26 décembre 2022✅ Mesuré
70nomic-ai/nomic-embed-text-v1Nomic AI🟢 Ouvert40,7 %31 janvier 2024✅ Mesuré
71Thenlper: GTE-BaseAlibaba🟢 Ouvert40,4 %18 novembre 2025✅ Mesuré
72Snowflake/snowflake-arctic-embed-m-v1.5Snowflake🟢 Ouvert40,3 %8 juillet 2024✅ Mesuré
73avsolatorio/GIST-large-Embedding-v0avsolatorio🟢 Ouvert40,2 %14 février 2024✅ Mesuré
74Intfloat: E5-Base-v2Intfloat🟢 Ouvert40,1 %18 novembre 2025✅ Mesuré
75avsolatorio/GIST-Embedding-v0avsolatorio🟢 Ouvert40,0 %31 janvier 2024✅ Mesuré
76sdadas/mmlw-e5-basesdadas🟢 Ouvert39,8 %17 novembre 2023✅ Mesuré
77manu/sentence_croissant_alpha_v0.3manu🟢 Ouvert39,4 %26 avril 2024✅ Mesuré
78sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert39,3 %1 novembre 2019✅ Mesuré
79abhinand/MedEmbed-small-v0.1abhinand🟢 Ouvert39,2 %20 octobre 2024✅ Mesuré
80sdadas/mmlw-roberta-largesdadas🟢 Ouvert39,2 %17 novembre 2023✅ Mesuré
81manu/sentence_croissant_alpha_v0.4manu🟢 Ouvert39,1 %27 avril 2024✅ Mesuré
82BAAI/bge-small-en-v1.5BAAI🟢 Ouvert39,0 %12 septembre 2023✅ Mesuré
83bigscience/sgpt-bloom-7b1-msmarcobigscience🟢 Ouvert38,9 %26 août 2022✅ Mesuré
84avsolatorio/NoInstruct-small-Embedding-v0avsolatorio🟢 Ouvert38,8 %1 mai 2024✅ Mesuré
85sdadas/mmlw-roberta-basesdadas🟢 Ouvert38,6 %17 novembre 2023✅ Mesuré
86intfloat/e5-small-v2Intfloat🟢 Ouvert38,6 %8 février 2024✅ Mesuré
87thenlper/gte-smallAlibaba🟢 Ouvert38,5 %27 juillet 2023✅ Mesuré
88Snowflake/snowflake-arctic-embed-m-longSnowflake🟢 Ouvert38,4 %12 avril 2024✅ Mesuré
89infgrad/stella-base-en-v2infgrad🟢 Ouvert38,2 %19 octobre 2023✅ Mesuré
90Snowflake/snowflake-arctic-embed-sSnowflake🟢 Ouvert38,1 %12 avril 2024✅ Mesuré
91sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert38,0 %1 novembre 2019✅ Mesuré
92intfloat/e5-smallIntfloat🟢 Ouvert37,9 %8 février 2024✅ Mesuré
93ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert37,3 %18 décembre 2024✅ Mesuré
94nomic-ai/nomic-embed-text-v1.5Nomic AI🟢 Ouvert37,3 %10 février 2024✅ Mesuré
95manu/sentence_croissant_alpha_v0.2manu🟢 Ouvert37,3 %15 mars 2024✅ Mesuré
96Omartificial-Intelligence-Space/Arabic-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert37,2 %14 juin 2024✅ Mesuré
97dwzhu/e5-base-4kdwzhu🟢 Ouvert36,9 %28 mars 2024✅ Mesuré
98avsolatorio/GIST-small-Embedding-v0avsolatorio🟢 Ouvert36,7 %3 février 2024✅ Mesuré
99Mihaiii/IvysaurMihaiii🟢 Ouvert35,8 %27 avril 2024✅ Mesuré
100sdadas/mmlw-e5-smallsdadas🟢 Ouvert35,3 %17 novembre 2023✅ Mesuré
101Snowflake/snowflake-arctic-embed-xsSnowflake🟢 Ouvert34,3 %8 juillet 2024✅ Mesuré
102McGill-NLP/LLM2Vec-Mistral-7B-Instruct-v2-mntp-unsup-simcseMcGill-NLP🟢 Ouvert34,2 %9 avril 2024✅ Mesuré
103Sentence Transformers: all-MiniLM-L12-v2Sentence Transformers🟢 Ouvert33,2 %18 novembre 2025✅ Mesuré
104Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert33,2 %25 juin 2024✅ Mesuré
105jinaai/jina-embedding-b-en-v1Jina AI🟢 Ouvert33,1 %7 juillet 2023✅ Mesuré
106Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert32,7 %17 novembre 2025✅ Mesuré
107shibing624/text2vec-base-multilingualshibing624🟢 Ouvert32,2 %22 juin 2023✅ Mesuré
108avsolatorio/GIST-all-MiniLM-L6-v2avsolatorio🟢 Ouvert32,2 %3 février 2024✅ Mesuré
109sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert32,1 %15 janvier 2025✅ Mesuré
110Gameselo/STS-multilingual-mpnet-base-v2Gameselo🟢 Ouvert31,9 %7 juin 2024✅ Mesuré
111Omartificial-Intelligence-Space/Arabic-labse-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert31,7 %16 juin 2024✅ Mesuré
112brahmairesearch/slx-v0.1brahmairesearch🟢 Ouvert30,9 %13 août 2024✅ Mesuré
113ai-forever/ru-en-RoSBERTaai-forever🟢 Ouvert30,7 %29 juillet 2024✅ Mesuré
114Mihaiii/BulbasaurMihaiii🟢 Ouvert30,5 %27 avril 2024✅ Mesuré
115Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert29,8 %17 novembre 2025✅ Mesuré
116Mihaiii/gte-micro-v4Mihaiii🟢 Ouvert29,8 %22 avril 2024✅ Mesuré
117deepfile/embedder-100pdeepfile🟢 Ouvert29,6 %24 juillet 2023✅ Mesuré
118sergeyzh/LaBSE-ru-turbosergeyzh🟢 Ouvert29,5 %27 juin 2024✅ Mesuré
119sentence-transformers/LaBSESentence Transformers🟢 Ouvert28,8 %1 novembre 2019✅ Mesuré
120jinaai/jina-embedding-s-en-v1Jina AI🟢 Ouvert28,4 %7 juillet 2023✅ Mesuré
121minishlab/potion-multilingual-128Mminishlab🟢 Ouvert27,8 %23 mai 2025✅ Mesuré
122NeuML/pubmedbert-base-embeddings-8MNeuML🟢 Ouvert27,6 %3 janvier 2025✅ Mesuré
123minishlab/potion-base-8Mminishlab🟢 Ouvert27,5 %29 octobre 2024✅ Mesuré
124omarelshehy/arabic-english-sts-matryoshkaomarelshehy🟢 Ouvert26,2 %13 octobre 2024✅ Mesuré
125minishlab/M2V_base_glove_subwordminishlab🟢 Ouvert26,1 %21 septembre 2024✅ Mesuré
126minishlab/potion-base-4Mminishlab🟢 Ouvert25,8 %29 octobre 2024✅ Mesuré
127Mihaiii/WartortleMihaiii🟢 Ouvert25,2 %30 avril 2024✅ Mesuré
128minishlab/M2V_base_outputminishlab🟢 Ouvert24,5 %21 septembre 2024✅ Mesuré
129Mihaiii/VenusaurMihaiii🟢 Ouvert24,2 %29 avril 2024✅ Mesuré
130deepvk/USER-basedeepvk🟢 Ouvert23,8 %10 juin 2024✅ Mesuré
131Mihaiii/SquirtleMihaiii🟢 Ouvert23,7 %30 avril 2024✅ Mesuré
132NeuML/pubmedbert-base-embeddings-2MNeuML🟢 Ouvert23,6 %3 janvier 2025✅ Mesuré
133consciousAI/cai-lunaris-text-embeddingsconsciousAI🟢 Ouvert23,2 %22 juin 2023✅ Mesuré
134NeuML/pubmedbert-base-embeddings-1MNeuML🟢 Ouvert23,2 %3 janvier 2025✅ Mesuré
135minishlab/M2V_base_gloveminishlab🟢 Ouvert22,4 %21 septembre 2024✅ Mesuré
136minishlab/potion-base-2Mminishlab🟢 Ouvert22,2 %29 octobre 2024✅ Mesuré
137cointegrated/LaBSE-en-rucointegrated🟢 Ouvert22,0 %10 juin 2021✅ Mesuré
138Mihaiii/gte-microMihaiii🟢 Ouvert21,3 %21 avril 2024✅ Mesuré
139jinaai/jina-embeddings-v2-base-enJina AI🟢 Ouvert21,1 %27 septembre 2023✅ Mesuré
140jinaai/jina-embeddings-v2-small-enJina AI🟢 Ouvert21,0 %27 septembre 2023✅ Mesuré
141NeuML/pubmedbert-base-embeddings-500KNeuML🟢 Ouvert20,6 %3 janvier 2025✅ Mesuré
142sergeyzh/rubert-tiny-turbosergeyzh🟢 Ouvert18,6 %21 juin 2024✅ Mesuré
143aari1995/German_Semantic_STS_V2aari1995🟢 Ouvert16,3 %17 novembre 2022✅ Mesuré
144Jaume/gemma-2b-embeddingsJaume🟢 Ouvert16,2 %29 juin 2024✅ Mesuré
145Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert13,2 %15 juin 2024✅ Mesuré
146NeuML/pubmedbert-base-embeddings-100KNeuML🟢 Ouvert12,5 %3 janvier 2025✅ Mesuré
147DeepPavlov/distilrubert-small-cased-conversationalDeepPavlov🟢 Ouvert12,0 %28 juin 2022✅ Mesuré
148cointegrated/rubert-tiny2cointegrated🟢 Ouvert11,4 %28 octobre 2021✅ Mesuré
149malenia1/ternary-weight-embeddingmalenia1🟢 Ouvert11,2 %23 octobre 2024✅ Mesuré
150Omartificial-Intelligence-Space/Arabert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert10,4 %16 juin 2024✅ Mesuré
151silma-ai/silma-embeddding-matryoshka-v0.1silma-ai🟢 Ouvert10,3 %12 octobre 2024✅ Mesuré
152DeepPavlov/rubert-base-cased-sentenceDeepPavlov🟢 Ouvert10,1 %4 mars 2020✅ Mesuré
153cointegrated/rubert-tinycointegrated🟢 Ouvert9,9 %24 mai 2021✅ Mesuré
154DeepPavlov/rubert-base-casedDeepPavlov🟢 Ouvert9,8 %4 mars 2020✅ Mesuré
155deepvk/deberta-v1-basedeepvk🟢 Ouvert9,2 %7 février 2023✅ Mesuré
156Omartificial-Intelligence-Space/Marbert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert7,5 %17 juin 2024✅ Mesuré
157ai-forever/sbert_large_mt_nlu_ruai-forever🟢 Ouvert7,5 %18 mai 2021✅ Mesuré
158ai-forever/sbert_large_nlu_ruai-forever🟢 Ouvert6,9 %20 novembre 2020✅ Mesuré

Classement établi sur 158 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 39,2 %.

Notre analyse

Un score élevé traduit une meilleure aptitude à faire remonter les contenus médicaux pertinents, à les réordonner ou à les regrouper selon la tâche. L’interprétation dépend toutefois de la métrique employée, notamment nDCG@10 pour certaines évaluations, et de la diversité des jeux réunis dans l’agrégat. Dans la base, le score médian de 39 % et le meilleur résultat de 67 %, obtenu par Alibaba-NLP/gte-Qwen2-7B-instruct, montrent un écart important entre le niveau central et la tête du classement. Cet écart ne suggère pas une saturation générale du benchmark. La portée reste centrée sur la recherche d’information médicale, principalement en anglais, et ne représente donc pas toutes les capacités possibles d’un modèle. L’accès public impose aussi de considérer le risque de contamination lors de l’interprétation des performances. Enfin, la rigueur comparative est limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs, plutôt que mesurés uniformément par une évaluation indépendante.


Sources des scores : mteb.