Code

MTEB: Code est un benchmark public créé en 2024 par la communauté MTEB / embeddings-benchmark. Il évalue la qualité de récupération de code dans un large éventail de langages de programmation, à partir de requêtes formulées en anglais.

MTEB: Code est un benchmark public créé en 2024 par la communauté MTEB / embeddings-benchmark. Il évalue la qualité de récupération de code dans un large éventail de langages de programmation, à partir de requêtes formulées en anglais.

Ses tâches couvrent la recherche de code, le text-to-SQL et le retour sur code. Le benchmark sert ainsi à comparer la capacité des modèles à retrouver des résultats pertinents dans différents contextes de programmation, au moyen d’un cadre commun centré sur la récupération.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / embeddings-benchmark (communauté)
Capacités mesuréesRécupération de code à travers de nombreux langages : code search, text-to-SQL, retour sur code (code feedback)
ModalitéTexte
Type de questionsrécupération de code (code retrieval)
Métrique d'évaluationNDCG@10
AccèsPublic
Languesanglais (requêtes) + 14+ langages de programmation
Taille du jeu12 tâches de récupération de code (14+ langages de programmation)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (42)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert80,8 %9 mars 2026✅ Mesuré
2codefuse-ai/C2LLM-7Bcodefuse-ai🟢 Ouvert80,7 %22 décembre 2025✅ Mesuré
3Bytedance/Seed1.6-embedding-1215ByteDance🟢 Ouvert80,7 %15 décembre 2025✅ Mesuré
4Qwen: Qwen3 Embedding 8BAlibaba Cloud / Qwen Team🟢 Ouvert80,7 %28 octobre 2025✅ Mesuré
5codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert80,2 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert80,2 %9 mars 2026✅ Mesuré
7Qwen: Qwen3 Embedding 4BAlibaba Cloud / Qwen Team🟢 Ouvert80,1 %28 octobre 2025✅ Mesuré
8codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert78,8 %9 mars 2026✅ Mesuré
9perplexity-ai/pplx-embed-v1-4bPerplexity🟢 Ouvert78,7 %11 février 2026✅ Mesuré
10ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1ICT-TIME-and-Querit🟢 Ouvert78,0 %2 mai 2026✅ Mesuré
11codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert77,4 %9 mars 2026✅ Mesuré
12google/gemini-embedding-001Google🟢 Ouvert76,0 %7 mars 2025✅ Mesuré
13perplexity-ai/pplx-embed-v1-0.6bPerplexity🟢 Ouvert75,8 %11 février 2026✅ Mesuré
14codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert75,7 %9 mars 2026✅ Mesuré
15codefuse-ai/C2LLM-0.5Bcodefuse-ai🟢 Ouvert75,5 %22 décembre 2025✅ Mesuré
16Qwen: Qwen3 Embedding 0.6BAlibaba Cloud / Qwen Team🟢 Ouvert75,4 %5 novembre 2025✅ Mesuré
17lightonai/LateOn-Codelightonai🟢 Ouvert74,1 %12 février 2026✅ Mesuré
18Shuu12121/NightOwl-CodeEmbeddingShuu12121🟢 Ouvert70,9 %8 juin 2026✅ Mesuré
19ICT-TIME-and-Querit/BOOM_4B_v1ICT-TIME-and-Querit🟢 Ouvert70,8 %31 janvier 2026✅ Mesuré
20codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert70,4 %9 mars 2026✅ Mesuré
21infly/inf-retriever-v1infly🟢 Ouvert69,7 %24 décembre 2024✅ Mesuré
22google/embeddinggemma-300mGoogle🟢 Ouvert68,8 %4 septembre 2025✅ Mesuré
23infly/inf-retriever-v1-1.5binfly🟢 Ouvert68,5 %8 février 2025✅ Mesuré
24codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert68,0 %9 mars 2026✅ Mesuré
25lightonai/LateOn-Code-edgelightonai🟢 Ouvert66,6 %12 février 2026✅ Mesuré
26ibm-granite/granite-embedding-311m-multilingual-r2IBM🟢 Ouvert63,8 %29 avril 2026✅ Mesuré
27lightonai/LateOn-Code-pretrainlightonai🟢 Ouvert63,8 %12 février 2026✅ Mesuré
28google/text-embedding-005Google🟢 Ouvert61,5 %18 novembre 2024✅ Mesuré
29ibm-granite/granite-embedding-97m-multilingual-r2IBM🟢 Ouvert60,4 %29 avril 2026✅ Mesuré
30lightonai/LateOn-Code-edge-pretrainlightonai🟢 Ouvert57,5 %12 février 2026✅ Mesuré
31ibm-granite/granite-embedding-english-r2IBM🟢 Ouvert57,2 %15 août 2025✅ Mesuré
32ibm-granite/granite-embedding-small-english-r2IBM🟢 Ouvert55,8 %15 août 2025✅ Mesuré
33w601sxs/b1ade-embedw601sxs🟢 Ouvert53,6 %10 mars 2025✅ Mesuré
34intfloat/multilingual-e5-smallIntfloat🟢 Ouvert53,5 %8 février 2024✅ Mesuré
35ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert53,3 %18 décembre 2024✅ Mesuré
36ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert50,3 %18 décembre 2024✅ Mesuré
37ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert48,4 %18 décembre 2024✅ Mesuré
38fyaronskiy/english_code_retrieverfyaronskiy🟢 Ouvert47,5 %10 juillet 2025✅ Mesuré
39ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert40,7 %18 décembre 2024✅ Mesuré
40MongoDB/mdbr-leaf-mtMongoDB🟢 Ouvert39,7 %27 août 2025✅ Mesuré
41sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert32,2 %15 janvier 2025✅ Mesuré
42minishlab/potion-multilingual-128Mminishlab🟢 Ouvert29,6 %23 mai 2025✅ Mesuré

Classement établi sur 42 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 69,2 %.

Notre analyse

Un score NDCG@10 élevé indique que le modèle place davantage de résultats pertinents parmi les dix premières réponses, avec une meilleure valorisation des résultats correctement classés en tête. Dans la base, 42 modèles sont évalués et le score médian atteint 69 %. codefuse-ai/F2LLM-v2-14B, publié par codefuse-ai, obtient le meilleur résultat à 81 %. Cet écart avec la médiane montre une hiérarchie encore visible, sans concentration complète des modèles au sommet.

L’interprétation du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une procédure de mesure entièrement centralisée. Cette caractéristique peut réduire l’homogénéité des comparaisons. La portée du benchmark reste celle de la récupération de code, sur 12 tâches couvrant plus de 14 langages, et non celle de l’ensemble des aptitudes de programmation. La diversité des tâches limite une lecture fondée sur un seul usage, mais un résultat global peut masquer des écarts entre code search, text-to-SQL et code feedback. Comme pour tout classement public, saturation et contamination constituent des points de vigilance lors de l’interprétation des performances.


Sources des scores : mteb.