codefuse-ai/C2LLM-7B

Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, C2LLM-7B est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Construit sur Qwen2.5-Coder, il représente chaque entrée par un vecteur de 3 584 dimensions.

Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, C2LLM-7B est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Construit sur Qwen2.5-Coder, il représente chaque entrée par un vecteur de 3 584 dimensions.

Le modèle est spécialisé dans la recherche sémantique appliquée aux logiciels. Il sert à retrouver des éléments dans des dépôts, alimenter un système RAG, mesurer la similarité ou regrouper des contenus par clustering. Son entraînement couvre les associations Text2Code, Code2Code et Code2Text, avec une instruction personnalisée facultative.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcodefuse-ai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie22 décembre 2025
Dimension du vecteur3 584
Représentationdense
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval79,6 %3ᵉ / 49mteb✅ Mesuré
MTEB: Code80,7 %2ᵉ / 43mteb✅ Mesuré
MTEB: CoREB60,1 %1ᵉ / 19mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Code Information Retrieval

▶ codefuse-ai/C2LLM-7B80 %

MTEB: Code

▶ codefuse-ai/C2LLM-7B81 %

Notre analyse

Forces. C2LLM-7B se classe parmi les meilleurs modèles évalués sur les tracks MTEB consacrés à la recherche d’information dans des langages de programmation variés. Sa première place sur CoREB souligne aussi sa solidité pour rapprocher descriptions et contenus logiciels dans les deux sens, ainsi que pour le reranking. Le pooling PMA, fondé sur une attention multi-tête, remplace le mean pooling et le last token pooling. L’affinage sur 3 millions de paires requête-document cible directement la recherche sémantique et la recherche dans les dépôts. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration, tandis que la compatibilité avec HuggingFace Transformers et Sentence-Transformers simplifie le déploiement.

Limites et points d’attention. Les vecteurs denses de 3 584 dimensions alourdissent les index et augmentent le coût de stockage, de calcul de similarité et de transfert par rapport à des représentations moins dimensionnelles. Les 8 milliards de paramètres actifs impliquent également une empreinte d’inférence notable. Malgré son rang de tête sur CoREB, son résultat absolu y est inférieur à ceux observés sur les tracks MTEB Code et Code Information Retrieval. Usages pertinents : recherche sémantique dans des dépôts, RAG sur des bases logicielles, rapprochement entre texte et contenus techniques, détection de similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).