Code Information Retrieval
MTEB: Code Information Retrieval est un benchmark public créé en 2024 par la CoIR team de Huawei Noah's Ark Lab. Il évalue la capacité des modèles à retrouver des informations pertinentes dans du code, à travers plusieurs langages de programmation et différents contextes techniques.
MTEB: Code Information Retrieval est un benchmark public créé en 2024 par la CoIR team de Huawei Noah's Ark Lab. Il évalue la capacité des modèles à retrouver des informations pertinentes dans du code, à travers plusieurs langages de programmation et différents contextes techniques.
Son périmètre couvre notamment la recherche de code, la question-réponse sur du code et la récupération text-to-SQL. Il sert ainsi à comparer les modèles sur des tâches où une requête en anglais doit conduire aux éléments de code les plus pertinents.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | CoIR team (Huawei Noah's Ark Lab) |
| Capacités mesurées | Récupération de code (code search, question-réponse sur code, text-to-SQL) à travers divers langages et tâches |
| Modalité | Texte |
| Type de questions | récupération d'information sur code (code information retrieval) |
| Métrique d'évaluation | NDCG@10 |
| Accès | Public |
| Langues | anglais + multiples langages de programmation |
| Taille du jeu | 10 datasets, 8 tâches de récupération, 7 domaines |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (48)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 79,9 % | 9 mars 2026 | ✅ Mesuré |
| 2 | Qwen: Qwen3 Embedding 8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,9 % | 28 octobre 2025 | ✅ Mesuré |
| 3 | codefuse-ai/C2LLM-7B | codefuse-ai | 🟢 Ouvert | 79,6 % | 22 décembre 2025 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 79,6 % | 9 mars 2026 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 79,6 % | 9 mars 2026 | ✅ Mesuré |
| 6 | Qwen: Qwen3 Embedding 4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,2 % | 28 octobre 2025 | ✅ Mesuré |
| 7 | voyageai/voyage-code-3 | Voyage AI | 🟢 Ouvert | 78,5 % | 4 décembre 2024 | ✅ Mesuré |
| 8 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 78,5 % | 9 mars 2026 | ✅ Mesuré |
| 9 | Bytedance/Seed1.6-embedding-1215 | ByteDance | 🟢 Ouvert | 78,3 % | 15 décembre 2025 | ✅ Mesuré |
| 10 | ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 77,7 % | 2 mai 2026 | ✅ Mesuré |
| 11 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 77,7 % | 9 mars 2026 | ✅ Mesuré |
| 12 | perplexity-ai/pplx-embed-v1-4b | Perplexity | 🟢 Ouvert | 77,3 % | 11 février 2026 | ✅ Mesuré |
| 13 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 76,1 % | 9 mars 2026 | ✅ Mesuré |
| 14 | Qwen: Qwen3 Embedding 0.6B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,0 % | 5 novembre 2025 | ✅ Mesuré |
| 15 | codefuse-ai/C2LLM-0.5B | codefuse-ai | 🟢 Ouvert | 74,5 % | 22 décembre 2025 | ✅ Mesuré |
| 16 | perplexity-ai/pplx-embed-v1-0.6b | Perplexity | 🟢 Ouvert | 74,4 % | 11 février 2026 | ✅ Mesuré |
| 17 | google/gemini-embedding-001 | 🟢 Ouvert | 73,9 % | 7 mars 2025 | ✅ Mesuré | |
| 18 | lightonai/LateOn-Code | lightonai | 🟢 Ouvert | 73,4 % | 12 février 2026 | ✅ Mesuré |
| 19 | jinaai/jina-embeddings-v4 | Jina AI | 🟢 Ouvert | 72,9 % | 24 juin 2025 | ✅ Mesuré |
| 20 | Qodo/Qodo-Embed-1-7B | Qodo | 🟢 Ouvert | 71,3 % | 24 février 2025 | ✅ Mesuré |
| 21 | Alibaba-NLP/gte-modernbert-base | Alibaba | 🟢 Ouvert | 71,1 % | 21 janvier 2025 | ✅ Mesuré |
| 22 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 70,5 % | 9 mars 2026 | ✅ Mesuré |
| 23 | ICT-TIME-and-Querit/BOOM_4B_v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 69,3 % | 31 janvier 2026 | ✅ Mesuré |
| 24 | Shuu12121/NightOwl-CodeEmbedding | Shuu12121 | 🟢 Ouvert | 68,7 % | 8 juin 2026 | ✅ Mesuré |
| 25 | Qodo/Qodo-Embed-1-1.5B | Qodo | 🟢 Ouvert | 68,5 % | 19 février 2025 | ✅ Mesuré |
| 26 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 68,4 % | 9 mars 2026 | ✅ Mesuré |
| 27 | infly/inf-retriever-v1 | infly | 🟢 Ouvert | 67,6 % | 24 décembre 2024 | ✅ Mesuré |
| 28 | google/embeddinggemma-300m | 🟢 Ouvert | 67,3 % | 4 septembre 2025 | ✅ Mesuré | |
| 29 | infly/inf-retriever-v1-1.5b | infly | 🟢 Ouvert | 66,4 % | 8 février 2025 | ✅ Mesuré |
| 30 | lightonai/LateOn-Code-edge | lightonai | 🟢 Ouvert | 65,0 % | 12 février 2026 | ✅ Mesuré |
| 31 | ibm-granite/granite-embedding-311m-multilingual-r2 | IBM | 🟢 Ouvert | 62,3 % | 29 avril 2026 | ✅ Mesuré |
| 32 | lightonai/LateOn-Code-pretrain | lightonai | 🟢 Ouvert | 60,5 % | 12 février 2026 | ✅ Mesuré |
| 33 | google/text-embedding-005 | 🟢 Ouvert | 59,7 % | 18 novembre 2024 | ✅ Mesuré | |
| 34 | ibm-granite/granite-embedding-97m-multilingual-r2 | IBM | 🟢 Ouvert | 58,7 % | 29 avril 2026 | ✅ Mesuré |
| 35 | ibm-granite/granite-embedding-english-r2 | IBM | 🟢 Ouvert | 54,6 % | 15 août 2025 | ✅ Mesuré |
| 36 | lightonai/LateOn-Code-edge-pretrain | lightonai | 🟢 Ouvert | 54,0 % | 12 février 2026 | ✅ Mesuré |
| 37 | ibm-granite/granite-embedding-small-english-r2 | IBM | 🟢 Ouvert | 53,5 % | 15 août 2025 | ✅ Mesuré |
| 38 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 51,3 % | 8 février 2024 | ✅ Mesuré |
| 39 | ibm-granite/granite-embedding-125m-english | IBM | 🟢 Ouvert | 50,3 % | 18 décembre 2024 | ✅ Mesuré |
| 40 | w601sxs/b1ade-embed | w601sxs | 🟢 Ouvert | 50,1 % | 10 mars 2025 | ✅ Mesuré |
| 41 | ibm-granite/granite-embedding-30m-english | IBM | 🟢 Ouvert | 46,9 % | 18 décembre 2024 | ✅ Mesuré |
| 42 | ibm-granite/granite-embedding-278m-multilingual | IBM | 🟢 Ouvert | 45,4 % | 18 décembre 2024 | ✅ Mesuré |
| 43 | fyaronskiy/english_code_retriever | fyaronskiy | 🟢 Ouvert | 44,8 % | 10 juillet 2025 | ✅ Mesuré |
| 44 | minishlab/potion-code-16M-v2 | minishlab | 🟢 Ouvert | 39,1 % | 8 juillet 2026 | ✅ Mesuré |
| 45 | ibm-granite/granite-embedding-107m-multilingual | IBM | 🟢 Ouvert | 36,7 % | 18 décembre 2024 | ✅ Mesuré |
| 46 | MongoDB/mdbr-leaf-mt | MongoDB | 🟢 Ouvert | 36,2 % | 27 août 2025 | ✅ Mesuré |
| 47 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 30,8 % | 15 janvier 2025 | ✅ Mesuré |
| 48 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 27,7 % | 23 mai 2025 | ✅ Mesuré |
Classement établi sur 48 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 68,6 %.
Notre analyse
Un score NDCG@10 élevé indique que le modèle place plus efficacement les résultats pertinents parmi les dix premières réponses. Avec une médiane de 69 % sur 48 modèles et un meilleur score de 80 % pour codefuse-ai/F2LLM-v2-14B, le classement montre un écart notable entre le niveau central et la meilleure performance, sans signaler une saturation complète du benchmark.
La lecture des résultats exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Cette méthode offre un cadre de comparaison commun, mais elle est moins rigoureuse qu'une évaluation indépendante réalisée dans des conditions uniformes. Le caractère public du benchmark implique aussi un risque de contamination si ses contenus sont intégrés aux données d'entraînement ou d'optimisation. Enfin, sa portée reste centrée sur la récupération d'information sur le code, dans dix datasets, huit tâches et sept domaines. Le classement renseigne donc sur cette capacité précise, et non sur l'ensemble des compétences de programmation d'un modèle.
Sources des scores : mteb.