RTEB Code
MTEB: RTEB Code est un benchmark public consacré à la qualité de la recherche d’information dans le domaine du code. Créé par Hugging Face, MongoDB et la communauté MTEB, il constitue un sous-ensemble spécialisé de RTEB.
MTEB: RTEB Code est un benchmark public consacré à la qualité de la recherche d’information dans le domaine du code. Créé par Hugging Face, MongoDB et la communauté MTEB, il constitue un sous-ensemble spécialisé de RTEB.
Il couvre des besoins représentatifs de la production, notamment les problèmes algorithmiques, la data science, l’évaluation de code, SQL et la recherche de code multilingue. Son rôle est de comparer la capacité des modèles à retrouver et classer des résultats pertinents dans ces différents contextes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Hugging Face, MongoDB et communaute MTEB |
| Capacités mesurées | Evalue la qualite de la recherche dans le domaine du code : problemes algorithmiques, taches data science, evaluation de code, recherche SQL et recherche de code multilingue, representatives de besoins de production reels. |
| Modalité | Texte |
| Type de questions | Recherche d'information dans le domaine du code (retrieval) |
| Métrique d'évaluation | nDCG@10 |
| Accès | Public |
| Langues | Code / multilingue (problemes algorithmiques, data science, evaluation de code, SQL, code multilingue) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 54,8 % | 9 mars 2026 | ✅ Mesuré |
| 2 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 39,3 % | 8 février 2024 | ✅ Mesuré |
| 3 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 18,0 % | 23 mai 2025 | ✅ Mesuré |
| 4 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 16,7 % | 15 janvier 2025 | ✅ Mesuré |
Classement établi sur 4 modèles évalués. Score médian de l'ensemble : 28,7 %.
Notre analyse
Un score nDCG@10 élevé indique que le modèle place plus efficacement les éléments pertinents parmi les dix premiers résultats, tout en tenant compte de leur ordre. Le classement disponible montre un écart marqué entre la médiane de 29 % et les 55 % de codefuse-ai/F2LLM-v2-80M, premier parmi les quatre modèles évalués dans la base. Ce niveau maximal, encore éloigné du plafond de la métrique, ne suggère pas de saturation du benchmark dans cet échantillon.
L’interprétation exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une mesure indépendante uniforme. La combinaison de jeux de données ouverts et fermés est pertinente pour limiter l’effet potentiel d’une exposition préalable aux contenus, sans supprimer à elle seule tout risque de contamination. Enfin, la portée reste spécialisée : MTEB: RTEB Code renseigne la recherche d’information appliquée au code et à ses différents sous-domaines, mais son classement ne doit pas être assimilé à une mesure générale de toutes les capacités d’un modèle.
Sources des scores : mteb.