Code Information Retrieval

MTEB: Code Information Retrieval est un benchmark public créé en 2024 par la CoIR team de Huawei Noah's Ark Lab. Il évalue la capacité des modèles à retrouver des informations pertinentes dans du code, à travers plusieurs langages de programmation et différents contextes techniques.

MTEB: Code Information Retrieval est un benchmark public créé en 2024 par la CoIR team de Huawei Noah's Ark Lab. Il évalue la capacité des modèles à retrouver des informations pertinentes dans du code, à travers plusieurs langages de programmation et différents contextes techniques.

Son périmètre couvre notamment la recherche de code, la question-réponse sur du code et la récupération text-to-SQL. Il sert ainsi à comparer les modèles sur des tâches où une requête en anglais doit conduire aux éléments de code les plus pertinents.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkCoIR team (Huawei Noah's Ark Lab)
Capacités mesuréesRécupération de code (code search, question-réponse sur code, text-to-SQL) à travers divers langages et tâches
ModalitéTexte
Type de questionsrécupération d'information sur code (code information retrieval)
Métrique d'évaluationNDCG@10
AccèsPublic
Languesanglais + multiples langages de programmation
Taille du jeu10 datasets, 8 tâches de récupération, 7 domaines
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (48)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert79,9 %9 mars 2026✅ Mesuré
2Qwen: Qwen3 Embedding 8BAlibaba Cloud / Qwen Team🟢 Ouvert79,9 %28 octobre 2025✅ Mesuré
3codefuse-ai/C2LLM-7Bcodefuse-ai🟢 Ouvert79,6 %22 décembre 2025✅ Mesuré
4codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert79,6 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert79,6 %9 mars 2026✅ Mesuré
6Qwen: Qwen3 Embedding 4BAlibaba Cloud / Qwen Team🟢 Ouvert79,2 %28 octobre 2025✅ Mesuré
7voyageai/voyage-code-3Voyage AI🟢 Ouvert78,5 %4 décembre 2024✅ Mesuré
8codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert78,5 %9 mars 2026✅ Mesuré
9Bytedance/Seed1.6-embedding-1215ByteDance🟢 Ouvert78,3 %15 décembre 2025✅ Mesuré
10ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1ICT-TIME-and-Querit🟢 Ouvert77,7 %2 mai 2026✅ Mesuré
11codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert77,7 %9 mars 2026✅ Mesuré
12perplexity-ai/pplx-embed-v1-4bPerplexity🟢 Ouvert77,3 %11 février 2026✅ Mesuré
13codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert76,1 %9 mars 2026✅ Mesuré
14Qwen: Qwen3 Embedding 0.6BAlibaba Cloud / Qwen Team🟢 Ouvert75,0 %5 novembre 2025✅ Mesuré
15codefuse-ai/C2LLM-0.5Bcodefuse-ai🟢 Ouvert74,5 %22 décembre 2025✅ Mesuré
16perplexity-ai/pplx-embed-v1-0.6bPerplexity🟢 Ouvert74,4 %11 février 2026✅ Mesuré
17google/gemini-embedding-001Google🟢 Ouvert73,9 %7 mars 2025✅ Mesuré
18lightonai/LateOn-Codelightonai🟢 Ouvert73,4 %12 février 2026✅ Mesuré
19jinaai/jina-embeddings-v4Jina AI🟢 Ouvert72,9 %24 juin 2025✅ Mesuré
20Qodo/Qodo-Embed-1-7BQodo🟢 Ouvert71,3 %24 février 2025✅ Mesuré
21Alibaba-NLP/gte-modernbert-baseAlibaba🟢 Ouvert71,1 %21 janvier 2025✅ Mesuré
22codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert70,5 %9 mars 2026✅ Mesuré
23ICT-TIME-and-Querit/BOOM_4B_v1ICT-TIME-and-Querit🟢 Ouvert69,3 %31 janvier 2026✅ Mesuré
24Shuu12121/NightOwl-CodeEmbeddingShuu12121🟢 Ouvert68,7 %8 juin 2026✅ Mesuré
25Qodo/Qodo-Embed-1-1.5BQodo🟢 Ouvert68,5 %19 février 2025✅ Mesuré
26codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert68,4 %9 mars 2026✅ Mesuré
27infly/inf-retriever-v1infly🟢 Ouvert67,6 %24 décembre 2024✅ Mesuré
28google/embeddinggemma-300mGoogle🟢 Ouvert67,3 %4 septembre 2025✅ Mesuré
29infly/inf-retriever-v1-1.5binfly🟢 Ouvert66,4 %8 février 2025✅ Mesuré
30lightonai/LateOn-Code-edgelightonai🟢 Ouvert65,0 %12 février 2026✅ Mesuré
31ibm-granite/granite-embedding-311m-multilingual-r2IBM🟢 Ouvert62,3 %29 avril 2026✅ Mesuré
32lightonai/LateOn-Code-pretrainlightonai🟢 Ouvert60,5 %12 février 2026✅ Mesuré
33google/text-embedding-005Google🟢 Ouvert59,7 %18 novembre 2024✅ Mesuré
34ibm-granite/granite-embedding-97m-multilingual-r2IBM🟢 Ouvert58,7 %29 avril 2026✅ Mesuré
35ibm-granite/granite-embedding-english-r2IBM🟢 Ouvert54,6 %15 août 2025✅ Mesuré
36lightonai/LateOn-Code-edge-pretrainlightonai🟢 Ouvert54,0 %12 février 2026✅ Mesuré
37ibm-granite/granite-embedding-small-english-r2IBM🟢 Ouvert53,5 %15 août 2025✅ Mesuré
38intfloat/multilingual-e5-smallIntfloat🟢 Ouvert51,3 %8 février 2024✅ Mesuré
39ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert50,3 %18 décembre 2024✅ Mesuré
40w601sxs/b1ade-embedw601sxs🟢 Ouvert50,1 %10 mars 2025✅ Mesuré
41ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert46,9 %18 décembre 2024✅ Mesuré
42ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert45,4 %18 décembre 2024✅ Mesuré
43fyaronskiy/english_code_retrieverfyaronskiy🟢 Ouvert44,8 %10 juillet 2025✅ Mesuré
44minishlab/potion-code-16M-v2minishlab🟢 Ouvert39,1 %8 juillet 2026✅ Mesuré
45ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert36,7 %18 décembre 2024✅ Mesuré
46MongoDB/mdbr-leaf-mtMongoDB🟢 Ouvert36,2 %27 août 2025✅ Mesuré
47sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert30,8 %15 janvier 2025✅ Mesuré
48minishlab/potion-multilingual-128Mminishlab🟢 Ouvert27,7 %23 mai 2025✅ Mesuré

Classement établi sur 48 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 68,6 %.

Notre analyse

Un score NDCG@10 élevé indique que le modèle place plus efficacement les résultats pertinents parmi les dix premières réponses. Avec une médiane de 69 % sur 48 modèles et un meilleur score de 80 % pour codefuse-ai/F2LLM-v2-14B, le classement montre un écart notable entre le niveau central et la meilleure performance, sans signaler une saturation complète du benchmark.

La lecture des résultats exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Cette méthode offre un cadre de comparaison commun, mais elle est moins rigoureuse qu'une évaluation indépendante réalisée dans des conditions uniformes. Le caractère public du benchmark implique aussi un risque de contamination si ses contenus sont intégrés aux données d'entraînement ou d'optimisation. Enfin, sa portée reste centrée sur la récupération d'information sur le code, dans dix datasets, huit tâches et sept domaines. Le classement renseigne donc sur cette capacité précise, et non sur l'ensemble des compétences de programmation d'un modèle.


Sources des scores : mteb.