codefuse-ai/C2LLM-0.5B

Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, codefuse-ai/C2LLM-0.5B est un modèle d’embedding dense de 497 millions de paramètres. Fondé sur Qwen2.5-Coder, il produit des vecteurs de 896 dimensions et emploie PMA, un pooling par attention multi-tête.

Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, codefuse-ai/C2LLM-0.5B est un modèle d’embedding dense de 497 millions de paramètres. Fondé sur Qwen2.5-Coder, il produit des vecteurs de 896 dimensions et emploie PMA, un pooling par attention multi-tête.

Affiné sur 3 millions de paires requête-document, il représente des requêtes textuelles et du code pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Il couvre les tâches Text2Code, Code2Code et Code2Text, avec une instruction personnalisable, via Hugging Face Transformers ou Sentence-Transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcodefuse-ai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie22 décembre 2025
Dimension du vecteur896
Représentationdense
Paramètres497 millions
Paramètres actifs497 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval74,5 %15ᵉ / 49mteb✅ Mesuré
MTEB: Code75,5 %15ᵉ / 43mteb✅ Mesuré
MTEB: CoREB58,1 %9ᵉ / 19mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent ses aptitudes principales dans la recherche de code et la recherche d’information parmi plusieurs langages de programmation et types de tâches. Les tracks Code et Code Information Retrieval affichent ses meilleurs résultats, tandis que son classement dans le top 10 de CoREB confirme un intérêt pour les correspondances entre texte et code, entre fragments de code, ainsi que pour le reranking. Le pooling PMA vise une agrégation plus élaborée que le mean pooling ou l’utilisation du dernier token. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement.

Limites et points d'attention. Le résultat CoREB reste sensiblement inférieur à ceux des deux tracks centrés sur le retrieval, ce qui signale une efficacité moins homogène lorsque l’évaluation combine embeddings, reranking et plusieurs directions de correspondance. Ses classements sur Code et Code Information Retrieval le situent derrière les modèles de tête de ces évaluations. Les vecteurs denses de 896 dimensions imposent par ailleurs un volume d’indexation et un coût de recherche à prendre en compte à grande échelle. Les usages pertinents sont la recherche de code, le RAG sur des dépôts logiciels, la détection de similarités et le regroupement de fragments apparentés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).