Code
MTEB: Code est un benchmark public créé en 2024 par la communauté MTEB / embeddings-benchmark. Il évalue la qualité de récupération de code dans un large éventail de langages de programmation, à partir de requêtes formulées en anglais.
MTEB: Code est un benchmark public créé en 2024 par la communauté MTEB / embeddings-benchmark. Il évalue la qualité de récupération de code dans un large éventail de langages de programmation, à partir de requêtes formulées en anglais.
Ses tâches couvrent la recherche de code, le text-to-SQL et le retour sur code. Le benchmark sert ainsi à comparer la capacité des modèles à retrouver des résultats pertinents dans différents contextes de programmation, au moyen d’un cadre commun centré sur la récupération.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (communauté) |
| Capacités mesurées | Récupération de code à travers de nombreux langages : code search, text-to-SQL, retour sur code (code feedback) |
| Modalité | Texte |
| Type de questions | récupération de code (code retrieval) |
| Métrique d'évaluation | NDCG@10 |
| Accès | Public |
| Langues | anglais (requêtes) + 14+ langages de programmation |
| Taille du jeu | 12 tâches de récupération de code (14+ langages de programmation) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (42)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 80,8 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/C2LLM-7B | codefuse-ai | 🟢 Ouvert | 80,7 % | 22 décembre 2025 | ✅ Mesuré |
| 3 | Bytedance/Seed1.6-embedding-1215 | ByteDance | 🟢 Ouvert | 80,7 % | 15 décembre 2025 | ✅ Mesuré |
| 4 | Qwen: Qwen3 Embedding 8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,7 % | 28 octobre 2025 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 80,2 % | 9 mars 2026 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 80,2 % | 9 mars 2026 | ✅ Mesuré |
| 7 | Qwen: Qwen3 Embedding 4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,1 % | 28 octobre 2025 | ✅ Mesuré |
| 8 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 78,8 % | 9 mars 2026 | ✅ Mesuré |
| 9 | perplexity-ai/pplx-embed-v1-4b | Perplexity | 🟢 Ouvert | 78,7 % | 11 février 2026 | ✅ Mesuré |
| 10 | ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 78,0 % | 2 mai 2026 | ✅ Mesuré |
| 11 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 77,4 % | 9 mars 2026 | ✅ Mesuré |
| 12 | google/gemini-embedding-001 | 🟢 Ouvert | 76,0 % | 7 mars 2025 | ✅ Mesuré | |
| 13 | perplexity-ai/pplx-embed-v1-0.6b | Perplexity | 🟢 Ouvert | 75,8 % | 11 février 2026 | ✅ Mesuré |
| 14 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 75,7 % | 9 mars 2026 | ✅ Mesuré |
| 15 | codefuse-ai/C2LLM-0.5B | codefuse-ai | 🟢 Ouvert | 75,5 % | 22 décembre 2025 | ✅ Mesuré |
| 16 | Qwen: Qwen3 Embedding 0.6B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,4 % | 5 novembre 2025 | ✅ Mesuré |
| 17 | lightonai/LateOn-Code | lightonai | 🟢 Ouvert | 74,1 % | 12 février 2026 | ✅ Mesuré |
| 18 | Shuu12121/NightOwl-CodeEmbedding | Shuu12121 | 🟢 Ouvert | 70,9 % | 8 juin 2026 | ✅ Mesuré |
| 19 | ICT-TIME-and-Querit/BOOM_4B_v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 70,8 % | 31 janvier 2026 | ✅ Mesuré |
| 20 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 70,4 % | 9 mars 2026 | ✅ Mesuré |
| 21 | infly/inf-retriever-v1 | infly | 🟢 Ouvert | 69,7 % | 24 décembre 2024 | ✅ Mesuré |
| 22 | google/embeddinggemma-300m | 🟢 Ouvert | 68,8 % | 4 septembre 2025 | ✅ Mesuré | |
| 23 | infly/inf-retriever-v1-1.5b | infly | 🟢 Ouvert | 68,5 % | 8 février 2025 | ✅ Mesuré |
| 24 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 68,0 % | 9 mars 2026 | ✅ Mesuré |
| 25 | lightonai/LateOn-Code-edge | lightonai | 🟢 Ouvert | 66,6 % | 12 février 2026 | ✅ Mesuré |
| 26 | ibm-granite/granite-embedding-311m-multilingual-r2 | IBM | 🟢 Ouvert | 63,8 % | 29 avril 2026 | ✅ Mesuré |
| 27 | lightonai/LateOn-Code-pretrain | lightonai | 🟢 Ouvert | 63,8 % | 12 février 2026 | ✅ Mesuré |
| 28 | google/text-embedding-005 | 🟢 Ouvert | 61,5 % | 18 novembre 2024 | ✅ Mesuré | |
| 29 | ibm-granite/granite-embedding-97m-multilingual-r2 | IBM | 🟢 Ouvert | 60,4 % | 29 avril 2026 | ✅ Mesuré |
| 30 | lightonai/LateOn-Code-edge-pretrain | lightonai | 🟢 Ouvert | 57,5 % | 12 février 2026 | ✅ Mesuré |
| 31 | ibm-granite/granite-embedding-english-r2 | IBM | 🟢 Ouvert | 57,2 % | 15 août 2025 | ✅ Mesuré |
| 32 | ibm-granite/granite-embedding-small-english-r2 | IBM | 🟢 Ouvert | 55,8 % | 15 août 2025 | ✅ Mesuré |
| 33 | w601sxs/b1ade-embed | w601sxs | 🟢 Ouvert | 53,6 % | 10 mars 2025 | ✅ Mesuré |
| 34 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 53,5 % | 8 février 2024 | ✅ Mesuré |
| 35 | ibm-granite/granite-embedding-125m-english | IBM | 🟢 Ouvert | 53,3 % | 18 décembre 2024 | ✅ Mesuré |
| 36 | ibm-granite/granite-embedding-30m-english | IBM | 🟢 Ouvert | 50,3 % | 18 décembre 2024 | ✅ Mesuré |
| 37 | ibm-granite/granite-embedding-278m-multilingual | IBM | 🟢 Ouvert | 48,4 % | 18 décembre 2024 | ✅ Mesuré |
| 38 | fyaronskiy/english_code_retriever | fyaronskiy | 🟢 Ouvert | 47,5 % | 10 juillet 2025 | ✅ Mesuré |
| 39 | ibm-granite/granite-embedding-107m-multilingual | IBM | 🟢 Ouvert | 40,7 % | 18 décembre 2024 | ✅ Mesuré |
| 40 | MongoDB/mdbr-leaf-mt | MongoDB | 🟢 Ouvert | 39,7 % | 27 août 2025 | ✅ Mesuré |
| 41 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 32,2 % | 15 janvier 2025 | ✅ Mesuré |
| 42 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 29,6 % | 23 mai 2025 | ✅ Mesuré |
Classement établi sur 42 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 69,2 %.
Notre analyse
Un score NDCG@10 élevé indique que le modèle place davantage de résultats pertinents parmi les dix premières réponses, avec une meilleure valorisation des résultats correctement classés en tête. Dans la base, 42 modèles sont évalués et le score médian atteint 69 %. codefuse-ai/F2LLM-v2-14B, publié par codefuse-ai, obtient le meilleur résultat à 81 %. Cet écart avec la médiane montre une hiérarchie encore visible, sans concentration complète des modèles au sommet.
L’interprétation du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une procédure de mesure entièrement centralisée. Cette caractéristique peut réduire l’homogénéité des comparaisons. La portée du benchmark reste celle de la récupération de code, sur 12 tâches couvrant plus de 14 langages, et non celle de l’ensemble des aptitudes de programmation. La diversité des tâches limite une lecture fondée sur un seul usage, mais un résultat global peut masquer des écarts entre code search, text-to-SQL et code feedback. Comme pour tout classement public, saturation et contamination constituent des points de vigilance lors de l’interprétation des performances.
Sources des scores : mteb.