Reasoning Retrieval
MTEB: Reasoning Retrieval est un benchmark de recherche documentaire conçu pour évaluer la capacité des modèles à relier des requêtes à des documents pertinents lorsque cette association exige un raisonnement approfondi, au-delà de simples ressemblances lexicales.
MTEB: Reasoning Retrieval est un benchmark de recherche documentaire conçu pour évaluer la capacité des modèles à relier des requêtes à des documents pertinents lorsque cette association exige un raisonnement approfondi, au-delà de simples ressemblances lexicales.
Créé en 2024 par BRIGHT, avec Hongjin Su, Howard Yen, Mengzhou Xia et leurs coauteurs, il repose sur des requêtes réelles couvrant notamment l’économie, la psychologie, les mathématiques et le code. Il permet ainsi de comparer la qualité des modèles de retrieval dans des situations variées, issues de données humaines naturelles et soigneusement sélectionnées.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | BRIGHT - Hongjin Su, Howard Yen, Mengzhou Xia et al. |
| Capacités mesurées | Retrieval exigeant un raisonnement intensif pour relier requêtes et documents (économie, psychologie, mathématiques, code, etc.), au-delà de la correspondance de surface. |
| Modalité | Texte |
| Type de questions | Retrieval intensif en raisonnement |
| Métrique d'évaluation | nDCG@10 |
| Accès | Public |
| Licence | CC BY 4.0 |
| Langues | Anglais |
| Taille du jeu | 1 384 requêtes réelles ; v1.1 dans MTEB = 18 tâches sur ~12 domaines |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (28)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | ByteDance-Seed/Seed1.5-Embedding | ByteDance Seed | 🟢 Ouvert | 27,2 % | 25 avril 2025 | ✅ Mesuré |
| 2 | Alibaba-NLP/gte-Qwen2-7B-instruct | Alibaba | 🟢 Ouvert | 22,9 % | 15 juin 2024 | ✅ Mesuré |
| 3 | Alibaba-NLP/gte-Qwen1.5-7B-instruct | Alibaba | 🟢 Ouvert | 22,1 % | 20 avril 2024 | ✅ Mesuré |
| 4 | GritLM/GritLM-7B | GritLM | 🟢 Ouvert | 20,6 % | 15 février 2024 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 19,7 % | 9 mars 2026 | ✅ Mesuré |
| 6 | google/text-embedding-004 | 🟢 Ouvert | 19,5 % | 14 mai 2024 | ✅ Mesuré | |
| 7 | Salesforce/SFR-Embedding-Mistral | Salesforce | 🟢 Ouvert | 18,0 % | 24 janvier 2024 | ✅ Mesuré |
| 8 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 17,7 % | 9 mars 2026 | ✅ Mesuré |
| 9 | voyageai/voyage-large-2-instruct | Voyage AI | 🟢 Ouvert | 17,6 % | 5 mai 2024 | ✅ Mesuré |
| 10 | openai/text-embedding-3-large | OpenAI | 🟢 Ouvert | 17,6 % | 25 janvier 2024 | ✅ Mesuré |
| 11 | intfloat/e5-mistral-7b-instruct | Intfloat | 🟢 Ouvert | 17,5 % | 8 février 2024 | ✅ Mesuré |
| 12 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 16,4 % | 9 mars 2026 | ✅ Mesuré |
| 13 | Cohere/Cohere-embed-english-v3.0 | Cohere | 🟢 Ouvert | 16,3 % | 2 novembre 2023 | ✅ Mesuré |
| 14 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 15,4 % | 9 mars 2026 | ✅ Mesuré |
| 15 | manveertamber/cadet-embed-base-v1 | manveertamber | 🟢 Ouvert | 15,1 % | 11 mai 2025 | ✅ Mesuré |
| 16 | infly/inf-retriever-v1 | infly | 🟢 Ouvert | 15,0 % | 24 décembre 2024 | ✅ Mesuré |
| 17 | Sentence Transformers: all-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 14,6 % | 17 novembre 2025 | ✅ Mesuré |
| 18 | BAAI: bge-large-en-v1.5 | BAAI | 🟢 Ouvert | 13,6 % | 18 novembre 2025 | ✅ Mesuré |
| 19 | infly/inf-retriever-v1-1.5b | infly | 🟢 Ouvert | 13,4 % | 8 février 2025 | ✅ Mesuré |
| 20 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 13,3 % | 9 mars 2026 | ✅ Mesuré |
| 21 | ibm-granite/granite-embedding-311m-multilingual-r2 | IBM | 🟢 Ouvert | 11,7 % | 29 avril 2026 | ✅ Mesuré |
| 22 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 11,6 % | 9 mars 2026 | ✅ Mesuré |
| 23 | ibm-granite/granite-embedding-97m-multilingual-r2 | IBM | 🟢 Ouvert | 10,5 % | 29 avril 2026 | ✅ Mesuré |
| 24 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 10,4 % | 9 mars 2026 | ✅ Mesuré |
| 25 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 8,7 % | 9 mars 2026 | ✅ Mesuré |
| 26 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 7,7 % | 8 février 2024 | ✅ Mesuré |
| 27 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 6,2 % | 23 mai 2025 | ✅ Mesuré |
| 28 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 6,2 % | 15 janvier 2025 | ✅ Mesuré |
Classement établi sur 28 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 15,2 %.
Notre analyse
Un score nDCG@10 élevé indique que le modèle place plus efficacement les documents pertinents parmi ses dix premiers résultats, y compris lorsque leur lien avec la requête nécessite plusieurs étapes de raisonnement. Dans la base évaluée, la médiane de 15 % et le meilleur score de 27 %, obtenu par ByteDance-Seed/Seed1.5-Embedding, montrent un avantage net du premier modèle, mais aussi une performance globale encore éloignée d’une saturation apparente.
La comparaison doit néanmoins rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans le cadre d’une mesure indépendante uniforme. Le recours à des requêtes réelles et à des données humaines soigneusement sélectionnées renforce l’ancrage pratique du benchmark. Sa portée reste toutefois circonscrite au retrieval intensif en raisonnement, en anglais, dans les domaines représentés par ses tâches. Le classement renseigne donc sur cette aptitude précise, sans constituer une mesure générale de toutes les capacités d’un modèle. L’utilisation de requêtes naturellement produites appelle également à surveiller le risque de contamination lors de comparaisons futures.
Sources des scores : mteb.