CoREB
MTEB: CoREB est un benchmark public consacré à la qualité des embeddings et du reranking de code. Publié en 2026 par les auteurs de « Beyond Retrieval: A Multitask Benchmark and Model for Code Search », il couvre la recherche code-vers-texte, texte-vers-code et code-vers-code.
MTEB: CoREB est un benchmark public consacré à la qualité des embeddings et du reranking de code. Publié en 2026 par les auteurs de « Beyond Retrieval: A Multitask Benchmark and Model for Code Search », il couvre la recherche code-vers-texte, texte-vers-code et code-vers-code.
À partir de problèmes LiveCodeBench réécrits de façon contrefactuelle dans cinq langages de programmation, il vise à limiter la contamination par les données d’entraînement. Il sert ainsi à comparer la capacité des modèles à représenter le code et à classer les résultats pertinents.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs de « Beyond Retrieval: A Multitask Benchmark and Model for Code Search » (organisation non confirmée) |
| Capacités mesurées | Qualité des embeddings et du reranking de code sur retrieval code-vers-texte, texte-vers-code et code-vers-code, avec données réécrites pour limiter la contamination. |
| Modalité | Texte |
| Type de questions | Embedding et reranking de code (text-to-code, code-to-text, code-to-code) |
| Métrique d'évaluation | nDCG@10 |
| Accès | Public |
| Langues | 5 langages de programmation (code) |
| Taille du jeu | Problèmes LiveCodeBench réécrits de façon contrefactuelle, 5 langages de programmation, releases datées |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/C2LLM-7B | codefuse-ai | 🟢 Ouvert | 60,1 % | 22 décembre 2025 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 60,1 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 59,6 % | 9 mars 2026 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 59,6 % | 9 mars 2026 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 59,5 % | 9 mars 2026 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 59,5 % | 9 mars 2026 | ✅ Mesuré |
| 7 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 59,4 % | 9 mars 2026 | ✅ Mesuré |
| 8 | Qwen: Qwen3 Embedding 8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,0 % | 28 octobre 2025 | ✅ Mesuré |
| 9 | codefuse-ai/C2LLM-0.5B | codefuse-ai | 🟢 Ouvert | 58,1 % | 22 décembre 2025 | ✅ Mesuré |
| 10 | codefuse-ai/F2LLM-1.7B | codefuse-ai | 🟢 Ouvert | 57,5 % | 18 septembre 2025 | ✅ Mesuré |
| 11 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 57,2 % | 9 mars 2026 | ✅ Mesuré |
| 12 | Qwen: Qwen3 Embedding 4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,5 % | 28 octobre 2025 | ✅ Mesuré |
| 13 | codefuse-ai/F2LLM-0.6B | codefuse-ai | 🟢 Ouvert | 56,2 % | 18 septembre 2025 | ✅ Mesuré |
| 14 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 55,8 % | 9 mars 2026 | ✅ Mesuré |
| 15 | Qwen: Qwen3 Embedding 0.6B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,1 % | 5 novembre 2025 | ✅ Mesuré |
| 16 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 32,0 % | 8 février 2024 | ✅ Mesuré |
| 17 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 26,3 % | 23 mai 2025 | ✅ Mesuré |
| 18 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 24,9 % | 15 janvier 2025 | ✅ Mesuré |
Classement établi sur 18 modèles évalués. Score médian de l'ensemble : 57,8 %.
Notre analyse
Un score nDCG@10 élevé indique que le modèle place plus efficacement les résultats pertinents parmi les dix premières réponses, dans les trois directions de recherche couvertes. L’évaluation porte donc à la fois sur la qualité des représentations de code et sur celle du reclassement. Les réécritures contrefactuelles et les releases datées renforcent la rigueur du protocole en cherchant à réduire la contamination, sans pour autant l’éliminer nécessairement.
La lecture du classement appelle toutefois à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante. Parmi les 18 modèles recensés, codefuse-ai/C2LLM-7B obtient 60 %, contre une médiane de 58 %. Cet écart réduit montre un classement resserré autour du meilleur résultat observé et limite la portée pratique de faibles différences de score. Il peut aussi signaler une discrimination limitée dans cette zone, sans suffire à établir une saturation générale. Enfin, la portée reste centrée sur le retrieval et le reranking de code, dans les cinq langages et les transformations de problèmes retenus.
Sources des scores : mteb.