RTEB Healthcare
MTEB: RTEB Healthcare est un benchmark créé par Hugging Face dans le cadre du projet RTEB / embedding-benchmark. Ce sous-ensemble spécialisé évalue la qualité de récupération d’embeddings dans les domaines de la santé et de la médecine, à partir de tâches représentatives d’usages réels…
MTEB: RTEB Healthcare est un benchmark créé par Hugging Face dans le cadre du projet RTEB / embedding-benchmark. Ce sous-ensemble spécialisé évalue la qualité de récupération d’embeddings dans les domaines de la santé et de la médecine, à partir de tâches représentatives d’usages réels en production.
Il couvre notamment les questions-réponses médicales, la recherche d’informations de santé et la consultation médicale multilingue. Son rôle est de comparer la capacité des modèles à retrouver et à classer des contenus pertinents dans un contexte médical, y compris entre plusieurs langues.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Hugging Face (projet RTEB / embedding-benchmark) |
| Capacités mesurées | Qualité de récupération d'embeddings dans le domaine de la santé/médical : Q&R médicale, recherche d'information santé, consultation médicale multilingue |
| Modalité | Texte |
| Type de questions | récupération d'information (retrieval) |
| Métrique d'évaluation | NDCG@10 |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | multilingue (20+ langues sur l'ensemble RTEB) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (95)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | voyageai/voyage-4-large (embed_dim=2048, evolved_prompts=True) | Voyage AI | 🟢 Ouvert | 74,0 % | 15 janvier 2026 | ✅ Mesuré |
| 2 | voyageai/voyage-4-large (embed_dim=2048) | Voyage AI | 🟢 Ouvert | 72,5 % | 15 janvier 2026 | ✅ Mesuré |
| 3 | voyageai/voyage-4-large | Voyage AI | 🟢 Ouvert | 71,8 % | 15 janvier 2026 | ✅ Mesuré |
| 4 | nvidia/Nemotron-3-Embed-8B-BF16 | NVIDIA | 🟢 Ouvert | 71,2 % | 16 juillet 2026 | ✅ Mesuré |
| 5 | Octen/Octen-Embedding-4B | Octen | 🟢 Ouvert | 68,4 % | 30 décembre 2025 | ✅ Mesuré |
| 6 | voyageai/voyage-4 | Voyage AI | 🟢 Ouvert | 68,3 % | 15 janvier 2026 | ✅ Mesuré |
| 7 | voyageai/voyage-3-large | Voyage AI | 🟢 Ouvert | 68,2 % | 7 janvier 2025 | ✅ Mesuré |
| 8 | Octen/Octen-Embedding-4B-INT8 | Octen | 🟢 Ouvert | 68,0 % | 2 avril 2026 | ✅ Mesuré |
| 9 | Octen/Octen-Embedding-8B | Octen | 🟢 Ouvert | 67,9 % | 23 décembre 2025 | ✅ Mesuré |
| 10 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 67,3 % | 9 mars 2026 | ✅ Mesuré |
| 11 | nvidia/NV-Embed-v2 | NVIDIA | 🟢 Ouvert | 67,3 % | 9 septembre 2024 | ✅ Mesuré |
| 12 | Qwen: Qwen3 Embedding 8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,0 % | 28 octobre 2025 | ✅ Mesuré |
| 13 | Octen/octen-vl-embedding-large | Octen | 🟢 Ouvert | 67,0 % | 15 mai 2026 | ✅ Mesuré |
| 14 | Octen/Octen-Embedding-8B-INT8 | Octen | 🟢 Ouvert | 66,7 % | 10 janvier 2026 | ✅ Mesuré |
| 15 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 66,7 % | 9 mars 2026 | ✅ Mesuré |
| 16 | google/gemini-embedding-001 | 🟢 Ouvert | 66,5 % | 7 mars 2025 | ✅ Mesuré | |
| 17 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 65,5 % | 9 mars 2026 | ✅ Mesuré |
| 18 | google/gemini-embedding-2-preview | 🟢 Ouvert | 64,6 % | 25 mars 2025 | ✅ Mesuré | |
| 19 | GritLM/GritLM-7B | GritLM | 🟢 Ouvert | 64,1 % | 15 février 2024 | ✅ Mesuré |
| 20 | ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 64,0 % | 2 mai 2026 | ✅ Mesuré |
| 21 | voyageai/voyage-3.5 (output_dtype=int8) | Voyage AI | 🟢 Ouvert | 63,9 % | 21 janvier 2025 | ✅ Mesuré |
| 22 | voyageai/voyage-3.5 | Voyage AI | 🟢 Ouvert | 63,9 % | 21 janvier 2025 | ✅ Mesuré |
| 23 | ICT-TIME-and-Querit/BOOM_4B_v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 63,6 % | 31 janvier 2026 | ✅ Mesuré |
| 24 | bflhc/MoD-Embedding | bflhc | 🟢 Ouvert | 63,5 % | 14 décembre 2025 | ✅ Mesuré |
| 25 | nvidia/Nemotron-3-Embed-1B-BF16 | NVIDIA | 🟢 Ouvert | 63,1 % | 16 juillet 2026 | ✅ Mesuré |
| 26 | Cohere/Cohere-embed-v4.0 (output_dtype=int8) | Cohere | 🟢 Ouvert | 62,7 % | 1 décembre 2024 | ✅ Mesuré |
| 27 | Cohere/Cohere-embed-v4.0 | Cohere | 🟢 Ouvert | 62,6 % | 1 décembre 2024 | ✅ Mesuré |
| 28 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 62,3 % | 1 avril 2026 | ✅ Mesuré |
| 29 | jinaai/jina-embeddings-v5-text-small | Jina AI | 🟢 Ouvert | 62,3 % | 17 février 2026 | ✅ Mesuré |
| 30 | openai/text-embedding-3-large | OpenAI | 🟢 Ouvert | 62,3 % | 25 janvier 2024 | ✅ Mesuré |
| 31 | voyageai/voyage-4-lite | Voyage AI | 🟢 Ouvert | 61,8 % | 15 janvier 2026 | ✅ Mesuré |
| 32 | intfloat/e5-mistral-7b-instruct | Intfloat | 🟢 Ouvert | 61,2 % | 8 février 2024 | ✅ Mesuré |
| 33 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 61,1 % | 1 avril 2026 | ✅ Mesuré |
| 34 | jinaai/jina-embeddings-v5-text-nano | Jina AI | 🟢 Ouvert | 61,1 % | 17 février 2026 | ✅ Mesuré |
| 35 | google/text-embedding-005 | 🟢 Ouvert | 60,6 % | 18 novembre 2024 | ✅ Mesuré | |
| 36 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 60,3 % | 9 mars 2026 | ✅ Mesuré |
| 37 | Octen/octen-vl-embedding | Octen | 🟢 Ouvert | 59,1 % | 15 mai 2026 | ✅ Mesuré |
| 38 | jinaai/jina-embeddings-v4 | Jina AI | 🟢 Ouvert | 58,7 % | 24 juin 2025 | ✅ Mesuré |
| 39 | Cohere/Cohere-embed-v4.0 (output_dtype=binary) | Cohere | 🟢 Ouvert | 57,9 % | 1 décembre 2024 | ✅ Mesuré |
| 40 | Snowflake/snowflake-arctic-embed-l-v2.0 | Snowflake | 🟢 Ouvert | 57,7 % | 4 décembre 2024 | ✅ Mesuré |
| 41 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 57,7 % | 9 mars 2026 | ✅ Mesuré |
| 42 | Alibaba-NLP/gte-multilingual-base | Alibaba | 🟢 Ouvert | 57,6 % | 20 juillet 2024 | ✅ Mesuré |
| 43 | telepix/PIXIE-Rune-v1.0 | telepix | 🟢 Ouvert | 57,1 % | 15 janvier 2026 | ✅ Mesuré |
| 44 | Octen/Octen-Embedding-0.6B | Octen | 🟢 Ouvert | 56,9 % | 10 janvier 2026 | ✅ Mesuré |
| 45 | Cohere/Cohere-embed-multilingual-v3.0 | Cohere | 🟢 Ouvert | 56,8 % | 2 novembre 2023 | ✅ Mesuré |
| 46 | voyageai/voyage-3.5 (output_dtype=binary) | Voyage AI | 🟢 Ouvert | 56,2 % | 21 janvier 2025 | ✅ Mesuré |
| 47 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 55,3 % | 9 mars 2026 | ✅ Mesuré |
| 48 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 55,0 % | 18 novembre 2025 | ✅ Mesuré |
| 49 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 54,2 % | 18 novembre 2025 | ✅ Mesuré |
| 50 | openai/text-embedding-3-small | OpenAI | 🟢 Ouvert | 52,3 % | 25 janvier 2024 | ✅ Mesuré |
| 51 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 51,4 % | 9 mars 2026 | ✅ Mesuré |
| 52 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 49,1 % | 9 mars 2026 | ✅ Mesuré |
| 53 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 49,0 % | 8 février 2024 | ✅ Mesuré |
| 54 | Cohere/Cohere-embed-english-v3.0 | Cohere | 🟢 Ouvert | 48,0 % | 2 novembre 2023 | ✅ Mesuré |
| 55 | mixedbread-ai/mxbai-embed-large-v1 | Mixedbread AI | 🟢 Ouvert | 46,9 % | 7 mars 2024 | ✅ Mesuré |
| 56 | ibm-granite/granite-embedding-311m-multilingual-r2 | IBM | 🟢 Ouvert | 46,9 % | 29 avril 2026 | ✅ Mesuré |
| 57 | WhereIsAI/UAE-Large-V1 | WhereIsAI | 🟢 Ouvert | 46,7 % | 4 décembre 2023 | ✅ Mesuré |
| 58 | BAAI/bge-m3-unsupervised | BAAI | 🟢 Ouvert | 46,7 % | 30 janvier 2024 | ✅ Mesuré |
| 59 | BAAI: bge-large-en-v1.5 | BAAI | 🟢 Ouvert | 46,1 % | 18 novembre 2025 | ✅ Mesuré |
| 60 | BAAI/bge-large-en | BAAI | 🟢 Ouvert | 45,8 % | 5 août 2023 | ✅ Mesuré |
| 61 | bisectgroup/BiCA-base | bisectgroup | 🟢 Ouvert | 45,0 % | 14 novembre 2025 | ✅ Mesuré |
| 62 | ibm-granite/granite-embedding-english-r2 | IBM | 🟢 Ouvert | 44,1 % | 15 août 2025 | ✅ Mesuré |
| 63 | BAAI: bge-base-en-v1.5 | BAAI | 🟢 Ouvert | 43,6 % | 18 novembre 2025 | ✅ Mesuré |
| 64 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 42,4 % | 8 février 2024 | ✅ Mesuré |
| 65 | Alibaba-NLP/gte-base-en-v1.5 | Alibaba | 🟢 Ouvert | 42,4 % | 20 juin 2024 | ✅ Mesuré |
| 66 | BAAI/bge-base-en | BAAI | 🟢 Ouvert | 42,0 % | 5 août 2023 | ✅ Mesuré |
| 67 | ibm-granite/granite-embedding-97m-multilingual-r2 | IBM | 🟢 Ouvert | 41,2 % | 29 avril 2026 | ✅ Mesuré |
| 68 | MongoDB/mdbr-leaf-ir | MongoDB | 🟢 Ouvert | 41,2 % | 27 août 2025 | ✅ Mesuré |
| 69 | ibm-granite/granite-embedding-small-english-r2 | IBM | 🟢 Ouvert | 40,1 % | 15 août 2025 | ✅ Mesuré |
| 70 | MongoDB/mdbr-leaf-mt | MongoDB | 🟢 Ouvert | 39,3 % | 27 août 2025 | ✅ Mesuré |
| 71 | BAAI/bge-small-en-v1.5 | BAAI | 🟢 Ouvert | 39,2 % | 12 septembre 2023 | ✅ Mesuré |
| 72 | Sentence Transformers: all-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 37,7 % | 17 novembre 2025 | ✅ Mesuré |
| 73 | Sentence Transformers: all-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 35,8 % | 18 novembre 2025 | ✅ Mesuré |
| 74 | Sentence Transformers: all-MiniLM-L6-v2 | Sentence Transformers | 🟢 Ouvert | 34,7 % | 17 novembre 2025 | ✅ Mesuré |
| 75 | jinaai/jina-embeddings-v2-small-en | Jina AI | 🟢 Ouvert | 32,5 % | 27 septembre 2023 | ✅ Mesuré |
| 76 | sentence-transformers/multi-qa-MiniLM-L6-cos-v1 | Sentence Transformers | 🟢 Ouvert | 32,1 % | 30 août 2021 | ✅ Mesuré |
| 77 | sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 30,6 % | 1 novembre 2019 | ✅ Mesuré |
| 78 | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 28,9 % | 1 novembre 2019 | ✅ Mesuré |
| 79 | jinaai/jina-embeddings-v2-base-en | Jina AI | 🟢 Ouvert | 27,3 % | 27 septembre 2023 | ✅ Mesuré |
| 80 | shibing624/text2vec-base-multilingual | shibing624 | 🟢 Ouvert | 21,0 % | 22 juin 2023 | ✅ Mesuré |
| 81 | sentence-transformers/static-retrieval-mrl-en-v1 | Sentence Transformers | 🟢 Ouvert | 20,0 % | 24 octobre 2024 | ✅ Mesuré |
| 82 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 17,5 % | 15 janvier 2025 | ✅ Mesuré |
| 83 | BAAI/bge-large-zh-v1.5 | BAAI | 🟢 Ouvert | 15,0 % | 12 septembre 2023 | ✅ Mesuré |
| 84 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 14,9 % | 23 mai 2025 | ✅ Mesuré |
| 85 | minishlab/potion-base-8M | minishlab | 🟢 Ouvert | 13,8 % | 29 octobre 2024 | ✅ Mesuré |
| 86 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 13,8 % | 1 novembre 2019 | ✅ Mesuré |
| 87 | BAAI/bge-base-zh-v1.5 | BAAI | 🟢 Ouvert | 13,6 % | 11 septembre 2023 | ✅ Mesuré |
| 88 | minishlab/potion-base-4M | minishlab | 🟢 Ouvert | 12,0 % | 29 octobre 2024 | ✅ Mesuré |
| 89 | minishlab/M2V_base_glove | minishlab | 🟢 Ouvert | 9,9 % | 21 septembre 2024 | ✅ Mesuré |
| 90 | minishlab/M2V_base_glove_subword | minishlab | 🟢 Ouvert | 9,0 % | 21 septembre 2024 | ✅ Mesuré |
| 91 | minishlab/potion-base-2M | minishlab | 🟢 Ouvert | 8,9 % | 29 octobre 2024 | ✅ Mesuré |
| 92 | minishlab/M2V_base_output | minishlab | 🟢 Ouvert | 8,4 % | 21 septembre 2024 | ✅ Mesuré |
| 93 | minishlab/M2V_multilingual_output | minishlab | 🟢 Ouvert | 7,2 % | 21 septembre 2024 | ✅ Mesuré |
| 94 | BAAI/bge-small-zh-v1.5 | BAAI | 🟢 Ouvert | 7,1 % | 12 septembre 2023 | ✅ Mesuré |
| 95 | shibing624/text2vec-base-chinese | shibing624 | 🟢 Ouvert | 4,1 % | 23 janvier 2022 | ✅ Mesuré |
Classement établi sur 95 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 55,0 %.
Notre analyse
Un score NDCG@10 élevé indique que le modèle place plus efficacement les résultats pertinents parmi les dix premières positions, en accordant davantage de valeur aux documents correctement classés en tête. Sur les 93 modèles évalués dans la base, voyageai/voyage-4-large (embed_dim=2048, evolved_prompts=True) atteint 74 %, contre une médiane de 54 %. Cet écart révèle une différenciation encore nette entre le meilleur résultat et le niveau central du classement, sans signe de saturation complète à son sommet.
L’interprétation doit néanmoins rester prudente. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une rigueur moindre qu’une évaluation entièrement mesurée et reproduite par une instance indépendante. Le jeu de test privé, dont les réponses ne sont pas divulguées, contribue à limiter l’exposition directe des cibles d’évaluation. RTEB Healthcare comprend toutefois des jeux ouverts et fermés, ce qui invite à considérer le risque de contamination différemment selon les tâches. Enfin, sa portée demeure spécialisée : le classement renseigne sur la récupération médicale et sanitaire multilingue, et non sur les capacités générales des modèles hors de ce domaine.
Sources des scores : mteb.