codefuse-ai/C2LLM-7B
Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, C2LLM-7B est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Construit sur Qwen2.5-Coder, il représente chaque entrée par un vecteur de 3 584 dimensions.
Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, C2LLM-7B est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Construit sur Qwen2.5-Coder, il représente chaque entrée par un vecteur de 3 584 dimensions.
Le modèle est spécialisé dans la recherche sémantique appliquée aux logiciels. Il sert à retrouver des éléments dans des dépôts, alimenter un système RAG, mesurer la similarité ou regrouper des contenus par clustering. Son entraînement couvre les associations Text2Code, Code2Code et Code2Text, avec une instruction personnalisée facultative.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 22 décembre 2025 |
| Dimension du vecteur | 3 584 |
| Représentation | dense |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 79,6 % | 3ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 80,7 % | 2ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: CoREB | 60,1 % | 1ᵉ / 19 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Code
Notre analyse
Forces. C2LLM-7B se classe parmi les meilleurs modèles évalués sur les tracks MTEB consacrés à la recherche d’information dans des langages de programmation variés. Sa première place sur CoREB souligne aussi sa solidité pour rapprocher descriptions et contenus logiciels dans les deux sens, ainsi que pour le reranking. Le pooling PMA, fondé sur une attention multi-tête, remplace le mean pooling et le last token pooling. L’affinage sur 3 millions de paires requête-document cible directement la recherche sémantique et la recherche dans les dépôts. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration, tandis que la compatibilité avec HuggingFace Transformers et Sentence-Transformers simplifie le déploiement.
Limites et points d’attention. Les vecteurs denses de 3 584 dimensions alourdissent les index et augmentent le coût de stockage, de calcul de similarité et de transfert par rapport à des représentations moins dimensionnelles. Les 8 milliards de paramètres actifs impliquent également une empreinte d’inférence notable. Malgré son rang de tête sur CoREB, son résultat absolu y est inférieur à ceux observés sur les tracks MTEB Code et Code Information Retrieval. Usages pertinents : recherche sémantique dans des dépôts, RAG sur des bases logicielles, rapprochement entre texte et contenus techniques, détection de similarité et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).