Reasoning Retrieval

MTEB: Reasoning Retrieval est un benchmark de recherche documentaire conçu pour évaluer la capacité des modèles à relier des requêtes à des documents pertinents lorsque cette association exige un raisonnement approfondi, au-delà de simples ressemblances lexicales.

MTEB: Reasoning Retrieval est un benchmark de recherche documentaire conçu pour évaluer la capacité des modèles à relier des requêtes à des documents pertinents lorsque cette association exige un raisonnement approfondi, au-delà de simples ressemblances lexicales.

Créé en 2024 par BRIGHT, avec Hongjin Su, Howard Yen, Mengzhou Xia et leurs coauteurs, il repose sur des requêtes réelles couvrant notamment l’économie, la psychologie, les mathématiques et le code. Il permet ainsi de comparer la qualité des modèles de retrieval dans des situations variées, issues de données humaines naturelles et soigneusement sélectionnées.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBRIGHT - Hongjin Su, Howard Yen, Mengzhou Xia et al.
Capacités mesuréesRetrieval exigeant un raisonnement intensif pour relier requêtes et documents (économie, psychologie, mathématiques, code, etc.), au-delà de la correspondance de surface.
ModalitéTexte
Type de questionsRetrieval intensif en raisonnement
Métrique d'évaluationnDCG@10
AccèsPublic
LicenceCC BY 4.0
LanguesAnglais
Taille du jeu1 384 requêtes réelles ; v1.1 dans MTEB = 18 tâches sur ~12 domaines
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (28)

#ModèleÉditeurLicenceScoreSortieFiabilité
1ByteDance-Seed/Seed1.5-EmbeddingByteDance Seed🟢 Ouvert27,2 %25 avril 2025✅ Mesuré
2Alibaba-NLP/gte-Qwen2-7B-instructAlibaba🟢 Ouvert22,9 %15 juin 2024✅ Mesuré
3Alibaba-NLP/gte-Qwen1.5-7B-instructAlibaba🟢 Ouvert22,1 %20 avril 2024✅ Mesuré
4GritLM/GritLM-7BGritLM🟢 Ouvert20,6 %15 février 2024✅ Mesuré
5codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert19,7 %9 mars 2026✅ Mesuré
6google/text-embedding-004Google🟢 Ouvert19,5 %14 mai 2024✅ Mesuré
7Salesforce/SFR-Embedding-MistralSalesforce🟢 Ouvert18,0 %24 janvier 2024✅ Mesuré
8codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert17,7 %9 mars 2026✅ Mesuré
9voyageai/voyage-large-2-instructVoyage AI🟢 Ouvert17,6 %5 mai 2024✅ Mesuré
10openai/text-embedding-3-largeOpenAI🟢 Ouvert17,6 %25 janvier 2024✅ Mesuré
11intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert17,5 %8 février 2024✅ Mesuré
12codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert16,4 %9 mars 2026✅ Mesuré
13Cohere/Cohere-embed-english-v3.0Cohere🟢 Ouvert16,3 %2 novembre 2023✅ Mesuré
14codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert15,4 %9 mars 2026✅ Mesuré
15manveertamber/cadet-embed-base-v1manveertamber🟢 Ouvert15,1 %11 mai 2025✅ Mesuré
16infly/inf-retriever-v1infly🟢 Ouvert15,0 %24 décembre 2024✅ Mesuré
17Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert14,6 %17 novembre 2025✅ Mesuré
18BAAI: bge-large-en-v1.5BAAI🟢 Ouvert13,6 %18 novembre 2025✅ Mesuré
19infly/inf-retriever-v1-1.5binfly🟢 Ouvert13,4 %8 février 2025✅ Mesuré
20codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert13,3 %9 mars 2026✅ Mesuré
21ibm-granite/granite-embedding-311m-multilingual-r2IBM🟢 Ouvert11,7 %29 avril 2026✅ Mesuré
22codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert11,6 %9 mars 2026✅ Mesuré
23ibm-granite/granite-embedding-97m-multilingual-r2IBM🟢 Ouvert10,5 %29 avril 2026✅ Mesuré
24codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert10,4 %9 mars 2026✅ Mesuré
25codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert8,7 %9 mars 2026✅ Mesuré
26intfloat/multilingual-e5-smallIntfloat🟢 Ouvert7,7 %8 février 2024✅ Mesuré
27minishlab/potion-multilingual-128Mminishlab🟢 Ouvert6,2 %23 mai 2025✅ Mesuré
28sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert6,2 %15 janvier 2025✅ Mesuré

Classement établi sur 28 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 15,2 %.

Notre analyse

Un score nDCG@10 élevé indique que le modèle place plus efficacement les documents pertinents parmi ses dix premiers résultats, y compris lorsque leur lien avec la requête nécessite plusieurs étapes de raisonnement. Dans la base évaluée, la médiane de 15 % et le meilleur score de 27 %, obtenu par ByteDance-Seed/Seed1.5-Embedding, montrent un avantage net du premier modèle, mais aussi une performance globale encore éloignée d’une saturation apparente.

La comparaison doit néanmoins rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans le cadre d’une mesure indépendante uniforme. Le recours à des requêtes réelles et à des données humaines soigneusement sélectionnées renforce l’ancrage pratique du benchmark. Sa portée reste toutefois circonscrite au retrieval intensif en raisonnement, en anglais, dans les domaines représentés par ses tâches. Le classement renseigne donc sur cette aptitude précise, sans constituer une mesure générale de toutes les capacités d’un modèle. L’utilisation de requêtes naturellement produites appelle également à surveiller le risque de contamination lors de comparaisons futures.


Sources des scores : mteb.