RTEB Code

MTEB: RTEB Code est un benchmark public consacré à la qualité de la recherche d’information dans le domaine du code. Créé par Hugging Face, MongoDB et la communauté MTEB, il constitue un sous-ensemble spécialisé de RTEB.

MTEB: RTEB Code est un benchmark public consacré à la qualité de la recherche d’information dans le domaine du code. Créé par Hugging Face, MongoDB et la communauté MTEB, il constitue un sous-ensemble spécialisé de RTEB.

Il couvre des besoins représentatifs de la production, notamment les problèmes algorithmiques, la data science, l’évaluation de code, SQL et la recherche de code multilingue. Son rôle est de comparer la capacité des modèles à retrouver et classer des résultats pertinents dans ces différents contextes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkHugging Face, MongoDB et communaute MTEB
Capacités mesuréesEvalue la qualite de la recherche dans le domaine du code : problemes algorithmiques, taches data science, evaluation de code, recherche SQL et recherche de code multilingue, representatives de besoins de production reels.
ModalitéTexte
Type de questionsRecherche d'information dans le domaine du code (retrieval)
Métrique d'évaluationnDCG@10
AccèsPublic
LanguesCode / multilingue (problemes algorithmiques, data science, evaluation de code, SQL, code multilingue)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert54,8 %9 mars 2026✅ Mesuré
2intfloat/multilingual-e5-smallIntfloat🟢 Ouvert39,3 %8 février 2024✅ Mesuré
3minishlab/potion-multilingual-128Mminishlab🟢 Ouvert18,0 %23 mai 2025✅ Mesuré
4sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert16,7 %15 janvier 2025✅ Mesuré

Classement établi sur 4 modèles évalués. Score médian de l'ensemble : 28,7 %.

Notre analyse

Un score nDCG@10 élevé indique que le modèle place plus efficacement les éléments pertinents parmi les dix premiers résultats, tout en tenant compte de leur ordre. Le classement disponible montre un écart marqué entre la médiane de 29 % et les 55 % de codefuse-ai/F2LLM-v2-80M, premier parmi les quatre modèles évalués dans la base. Ce niveau maximal, encore éloigné du plafond de la métrique, ne suggère pas de saturation du benchmark dans cet échantillon.

L’interprétation exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une mesure indépendante uniforme. La combinaison de jeux de données ouverts et fermés est pertinente pour limiter l’effet potentiel d’une exposition préalable aux contenus, sans supprimer à elle seule tout risque de contamination. Enfin, la portée reste spécialisée : MTEB: RTEB Code renseigne la recherche d’information appliquée au code et à ses différents sous-domaines, mais son classement ne doit pas être assimilé à une mesure générale de toutes les capacités d’un modèle.


Sources des scores : mteb.