CoREB

MTEB: CoREB est un benchmark public consacré à la qualité des embeddings et du reranking de code. Publié en 2026 par les auteurs de « Beyond Retrieval: A Multitask Benchmark and Model for Code Search », il couvre la recherche code-vers-texte, texte-vers-code et code-vers-code.

MTEB: CoREB est un benchmark public consacré à la qualité des embeddings et du reranking de code. Publié en 2026 par les auteurs de « Beyond Retrieval: A Multitask Benchmark and Model for Code Search », il couvre la recherche code-vers-texte, texte-vers-code et code-vers-code.

À partir de problèmes LiveCodeBench réécrits de façon contrefactuelle dans cinq langages de programmation, il vise à limiter la contamination par les données d’entraînement. Il sert ainsi à comparer la capacité des modèles à représenter le code et à classer les résultats pertinents.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs de « Beyond Retrieval: A Multitask Benchmark and Model for Code Search » (organisation non confirmée)
Capacités mesuréesQualité des embeddings et du reranking de code sur retrieval code-vers-texte, texte-vers-code et code-vers-code, avec données réécrites pour limiter la contamination.
ModalitéTexte
Type de questionsEmbedding et reranking de code (text-to-code, code-to-text, code-to-code)
Métrique d'évaluationnDCG@10
AccèsPublic
Langues5 langages de programmation (code)
Taille du jeuProblèmes LiveCodeBench réécrits de façon contrefactuelle, 5 langages de programmation, releases datées
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/C2LLM-7Bcodefuse-ai🟢 Ouvert60,1 %22 décembre 2025✅ Mesuré
2codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert60,1 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert59,6 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert59,6 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert59,5 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert59,5 %9 mars 2026✅ Mesuré
7codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert59,4 %9 mars 2026✅ Mesuré
8Qwen: Qwen3 Embedding 8BAlibaba Cloud / Qwen Team🟢 Ouvert59,0 %28 octobre 2025✅ Mesuré
9codefuse-ai/C2LLM-0.5Bcodefuse-ai🟢 Ouvert58,1 %22 décembre 2025✅ Mesuré
10codefuse-ai/F2LLM-1.7Bcodefuse-ai🟢 Ouvert57,5 %18 septembre 2025✅ Mesuré
11codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert57,2 %9 mars 2026✅ Mesuré
12Qwen: Qwen3 Embedding 4BAlibaba Cloud / Qwen Team🟢 Ouvert56,5 %28 octobre 2025✅ Mesuré
13codefuse-ai/F2LLM-0.6Bcodefuse-ai🟢 Ouvert56,2 %18 septembre 2025✅ Mesuré
14codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert55,8 %9 mars 2026✅ Mesuré
15Qwen: Qwen3 Embedding 0.6BAlibaba Cloud / Qwen Team🟢 Ouvert54,1 %5 novembre 2025✅ Mesuré
16intfloat/multilingual-e5-smallIntfloat🟢 Ouvert32,0 %8 février 2024✅ Mesuré
17minishlab/potion-multilingual-128Mminishlab🟢 Ouvert26,3 %23 mai 2025✅ Mesuré
18sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert24,9 %15 janvier 2025✅ Mesuré

Classement établi sur 18 modèles évalués. Score médian de l'ensemble : 57,8 %.

Notre analyse

Un score nDCG@10 élevé indique que le modèle place plus efficacement les résultats pertinents parmi les dix premières réponses, dans les trois directions de recherche couvertes. L’évaluation porte donc à la fois sur la qualité des représentations de code et sur celle du reclassement. Les réécritures contrefactuelles et les releases datées renforcent la rigueur du protocole en cherchant à réduire la contamination, sans pour autant l’éliminer nécessairement.

La lecture du classement appelle toutefois à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante. Parmi les 18 modèles recensés, codefuse-ai/C2LLM-7B obtient 60 %, contre une médiane de 58 %. Cet écart réduit montre un classement resserré autour du meilleur résultat observé et limite la portée pratique de faibles différences de score. Il peut aussi signaler une discrimination limitée dans cette zone, sans suffire à établir une saturation générale. Enfin, la portée reste centrée sur le retrieval et le reranking de code, dans les cinq langages et les transformations de problèmes retenus.


Sources des scores : mteb.