RTEB Healthcare

MTEB: RTEB Healthcare est un benchmark créé par Hugging Face dans le cadre du projet RTEB / embedding-benchmark. Ce sous-ensemble spécialisé évalue la qualité de récupération d’embeddings dans les domaines de la santé et de la médecine, à partir de tâches représentatives d’usages réels…

MTEB: RTEB Healthcare est un benchmark créé par Hugging Face dans le cadre du projet RTEB / embedding-benchmark. Ce sous-ensemble spécialisé évalue la qualité de récupération d’embeddings dans les domaines de la santé et de la médecine, à partir de tâches représentatives d’usages réels en production.

Il couvre notamment les questions-réponses médicales, la recherche d’informations de santé et la consultation médicale multilingue. Son rôle est de comparer la capacité des modèles à retrouver et à classer des contenus pertinents dans un contexte médical, y compris entre plusieurs langues.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkHugging Face (projet RTEB / embedding-benchmark)
Capacités mesuréesQualité de récupération d'embeddings dans le domaine de la santé/médical : Q&R médicale, recherche d'information santé, consultation médicale multilingue
ModalitéTexte
Type de questionsrécupération d'information (retrieval)
Métrique d'évaluationNDCG@10
AccèsJeu de test privé (réponses non divulguées)
Languesmultilingue (20+ langues sur l'ensemble RTEB)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (95)

#ModèleÉditeurLicenceScoreSortieFiabilité
1voyageai/voyage-4-large (embed_dim=2048, evolved_prompts=True)Voyage AI🟢 Ouvert74,0 %15 janvier 2026✅ Mesuré
2voyageai/voyage-4-large (embed_dim=2048)Voyage AI🟢 Ouvert72,5 %15 janvier 2026✅ Mesuré
3voyageai/voyage-4-largeVoyage AI🟢 Ouvert71,8 %15 janvier 2026✅ Mesuré
4nvidia/Nemotron-3-Embed-8B-BF16NVIDIA🟢 Ouvert71,2 %16 juillet 2026✅ Mesuré
5Octen/Octen-Embedding-4BOcten🟢 Ouvert68,4 %30 décembre 2025✅ Mesuré
6voyageai/voyage-4Voyage AI🟢 Ouvert68,3 %15 janvier 2026✅ Mesuré
7voyageai/voyage-3-largeVoyage AI🟢 Ouvert68,2 %7 janvier 2025✅ Mesuré
8Octen/Octen-Embedding-4B-INT8Octen🟢 Ouvert68,0 %2 avril 2026✅ Mesuré
9Octen/Octen-Embedding-8BOcten🟢 Ouvert67,9 %23 décembre 2025✅ Mesuré
10codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert67,3 %9 mars 2026✅ Mesuré
11nvidia/NV-Embed-v2NVIDIA🟢 Ouvert67,3 %9 septembre 2024✅ Mesuré
12Qwen: Qwen3 Embedding 8BAlibaba Cloud / Qwen Team🟢 Ouvert67,0 %28 octobre 2025✅ Mesuré
13Octen/octen-vl-embedding-largeOcten🟢 Ouvert67,0 %15 mai 2026✅ Mesuré
14Octen/Octen-Embedding-8B-INT8Octen🟢 Ouvert66,7 %10 janvier 2026✅ Mesuré
15codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert66,7 %9 mars 2026✅ Mesuré
16google/gemini-embedding-001Google🟢 Ouvert66,5 %7 mars 2025✅ Mesuré
17codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert65,5 %9 mars 2026✅ Mesuré
18google/gemini-embedding-2-previewGoogle🟢 Ouvert64,6 %25 mars 2025✅ Mesuré
19GritLM/GritLM-7BGritLM🟢 Ouvert64,1 %15 février 2024✅ Mesuré
20ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1ICT-TIME-and-Querit🟢 Ouvert64,0 %2 mai 2026✅ Mesuré
21voyageai/voyage-3.5 (output_dtype=int8)Voyage AI🟢 Ouvert63,9 %21 janvier 2025✅ Mesuré
22voyageai/voyage-3.5Voyage AI🟢 Ouvert63,9 %21 janvier 2025✅ Mesuré
23ICT-TIME-and-Querit/BOOM_4B_v1ICT-TIME-and-Querit🟢 Ouvert63,6 %31 janvier 2026✅ Mesuré
24bflhc/MoD-Embeddingbflhc🟢 Ouvert63,5 %14 décembre 2025✅ Mesuré
25nvidia/Nemotron-3-Embed-1B-BF16NVIDIA🟢 Ouvert63,1 %16 juillet 2026✅ Mesuré
26Cohere/Cohere-embed-v4.0 (output_dtype=int8)Cohere🟢 Ouvert62,7 %1 décembre 2024✅ Mesuré
27Cohere/Cohere-embed-v4.0Cohere🟢 Ouvert62,6 %1 décembre 2024✅ Mesuré
28jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert62,3 %1 avril 2026✅ Mesuré
29jinaai/jina-embeddings-v5-text-smallJina AI🟢 Ouvert62,3 %17 février 2026✅ Mesuré
30openai/text-embedding-3-largeOpenAI🟢 Ouvert62,3 %25 janvier 2024✅ Mesuré
31voyageai/voyage-4-liteVoyage AI🟢 Ouvert61,8 %15 janvier 2026✅ Mesuré
32intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert61,2 %8 février 2024✅ Mesuré
33jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert61,1 %1 avril 2026✅ Mesuré
34jinaai/jina-embeddings-v5-text-nanoJina AI🟢 Ouvert61,1 %17 février 2026✅ Mesuré
35google/text-embedding-005Google🟢 Ouvert60,6 %18 novembre 2024✅ Mesuré
36codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert60,3 %9 mars 2026✅ Mesuré
37Octen/octen-vl-embeddingOcten🟢 Ouvert59,1 %15 mai 2026✅ Mesuré
38jinaai/jina-embeddings-v4Jina AI🟢 Ouvert58,7 %24 juin 2025✅ Mesuré
39Cohere/Cohere-embed-v4.0 (output_dtype=binary)Cohere🟢 Ouvert57,9 %1 décembre 2024✅ Mesuré
40Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert57,7 %4 décembre 2024✅ Mesuré
41codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert57,7 %9 mars 2026✅ Mesuré
42Alibaba-NLP/gte-multilingual-baseAlibaba🟢 Ouvert57,6 %20 juillet 2024✅ Mesuré
43telepix/PIXIE-Rune-v1.0telepix🟢 Ouvert57,1 %15 janvier 2026✅ Mesuré
44Octen/Octen-Embedding-0.6BOcten🟢 Ouvert56,9 %10 janvier 2026✅ Mesuré
45Cohere/Cohere-embed-multilingual-v3.0Cohere🟢 Ouvert56,8 %2 novembre 2023✅ Mesuré
46voyageai/voyage-3.5 (output_dtype=binary)Voyage AI🟢 Ouvert56,2 %21 janvier 2025✅ Mesuré
47codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert55,3 %9 mars 2026✅ Mesuré
48BAAI: bge-m3BAAI🟢 Ouvert55,0 %18 novembre 2025✅ Mesuré
49Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert54,2 %18 novembre 2025✅ Mesuré
50openai/text-embedding-3-smallOpenAI🟢 Ouvert52,3 %25 janvier 2024✅ Mesuré
51codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert51,4 %9 mars 2026✅ Mesuré
52codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert49,1 %9 mars 2026✅ Mesuré
53intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert49,0 %8 février 2024✅ Mesuré
54Cohere/Cohere-embed-english-v3.0Cohere🟢 Ouvert48,0 %2 novembre 2023✅ Mesuré
55mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert46,9 %7 mars 2024✅ Mesuré
56ibm-granite/granite-embedding-311m-multilingual-r2IBM🟢 Ouvert46,9 %29 avril 2026✅ Mesuré
57WhereIsAI/UAE-Large-V1WhereIsAI🟢 Ouvert46,7 %4 décembre 2023✅ Mesuré
58BAAI/bge-m3-unsupervisedBAAI🟢 Ouvert46,7 %30 janvier 2024✅ Mesuré
59BAAI: bge-large-en-v1.5BAAI🟢 Ouvert46,1 %18 novembre 2025✅ Mesuré
60BAAI/bge-large-enBAAI🟢 Ouvert45,8 %5 août 2023✅ Mesuré
61bisectgroup/BiCA-basebisectgroup🟢 Ouvert45,0 %14 novembre 2025✅ Mesuré
62ibm-granite/granite-embedding-english-r2IBM🟢 Ouvert44,1 %15 août 2025✅ Mesuré
63BAAI: bge-base-en-v1.5BAAI🟢 Ouvert43,6 %18 novembre 2025✅ Mesuré
64intfloat/multilingual-e5-smallIntfloat🟢 Ouvert42,4 %8 février 2024✅ Mesuré
65Alibaba-NLP/gte-base-en-v1.5Alibaba🟢 Ouvert42,4 %20 juin 2024✅ Mesuré
66BAAI/bge-base-enBAAI🟢 Ouvert42,0 %5 août 2023✅ Mesuré
67ibm-granite/granite-embedding-97m-multilingual-r2IBM🟢 Ouvert41,2 %29 avril 2026✅ Mesuré
68MongoDB/mdbr-leaf-irMongoDB🟢 Ouvert41,2 %27 août 2025✅ Mesuré
69ibm-granite/granite-embedding-small-english-r2IBM🟢 Ouvert40,1 %15 août 2025✅ Mesuré
70MongoDB/mdbr-leaf-mtMongoDB🟢 Ouvert39,3 %27 août 2025✅ Mesuré
71BAAI/bge-small-en-v1.5BAAI🟢 Ouvert39,2 %12 septembre 2023✅ Mesuré
72Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert37,7 %17 novembre 2025✅ Mesuré
73Sentence Transformers: all-MiniLM-L12-v2Sentence Transformers🟢 Ouvert35,8 %18 novembre 2025✅ Mesuré
74Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert34,7 %17 novembre 2025✅ Mesuré
75jinaai/jina-embeddings-v2-small-enJina AI🟢 Ouvert32,5 %27 septembre 2023✅ Mesuré
76sentence-transformers/multi-qa-MiniLM-L6-cos-v1Sentence Transformers🟢 Ouvert32,1 %30 août 2021✅ Mesuré
77sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert30,6 %1 novembre 2019✅ Mesuré
78sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert28,9 %1 novembre 2019✅ Mesuré
79jinaai/jina-embeddings-v2-base-enJina AI🟢 Ouvert27,3 %27 septembre 2023✅ Mesuré
80shibing624/text2vec-base-multilingualshibing624🟢 Ouvert21,0 %22 juin 2023✅ Mesuré
81sentence-transformers/static-retrieval-mrl-en-v1Sentence Transformers🟢 Ouvert20,0 %24 octobre 2024✅ Mesuré
82sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert17,5 %15 janvier 2025✅ Mesuré
83BAAI/bge-large-zh-v1.5BAAI🟢 Ouvert15,0 %12 septembre 2023✅ Mesuré
84minishlab/potion-multilingual-128Mminishlab🟢 Ouvert14,9 %23 mai 2025✅ Mesuré
85minishlab/potion-base-8Mminishlab🟢 Ouvert13,8 %29 octobre 2024✅ Mesuré
86sentence-transformers/LaBSESentence Transformers🟢 Ouvert13,8 %1 novembre 2019✅ Mesuré
87BAAI/bge-base-zh-v1.5BAAI🟢 Ouvert13,6 %11 septembre 2023✅ Mesuré
88minishlab/potion-base-4Mminishlab🟢 Ouvert12,0 %29 octobre 2024✅ Mesuré
89minishlab/M2V_base_gloveminishlab🟢 Ouvert9,9 %21 septembre 2024✅ Mesuré
90minishlab/M2V_base_glove_subwordminishlab🟢 Ouvert9,0 %21 septembre 2024✅ Mesuré
91minishlab/potion-base-2Mminishlab🟢 Ouvert8,9 %29 octobre 2024✅ Mesuré
92minishlab/M2V_base_outputminishlab🟢 Ouvert8,4 %21 septembre 2024✅ Mesuré
93minishlab/M2V_multilingual_outputminishlab🟢 Ouvert7,2 %21 septembre 2024✅ Mesuré
94BAAI/bge-small-zh-v1.5BAAI🟢 Ouvert7,1 %12 septembre 2023✅ Mesuré
95shibing624/text2vec-base-chineseshibing624🟢 Ouvert4,1 %23 janvier 2022✅ Mesuré

Classement établi sur 95 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 55,0 %.

Notre analyse

Un score NDCG@10 élevé indique que le modèle place plus efficacement les résultats pertinents parmi les dix premières positions, en accordant davantage de valeur aux documents correctement classés en tête. Sur les 93 modèles évalués dans la base, voyageai/voyage-4-large (embed_dim=2048, evolved_prompts=True) atteint 74 %, contre une médiane de 54 %. Cet écart révèle une différenciation encore nette entre le meilleur résultat et le niveau central du classement, sans signe de saturation complète à son sommet.

L’interprétation doit néanmoins rester prudente. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une rigueur moindre qu’une évaluation entièrement mesurée et reproduite par une instance indépendante. Le jeu de test privé, dont les réponses ne sont pas divulguées, contribue à limiter l’exposition directe des cibles d’évaluation. RTEB Healthcare comprend toutefois des jeux ouverts et fermés, ce qui invite à considérer le risque de contamination différemment selon les tâches. Enfin, sa portée demeure spécialisée : le classement renseigne sur la récupération médicale et sanitaire multilingue, et non sur les capacités générales des modèles hors de ce domaine.


Sources des scores : mteb.