codefuse-ai/C2LLM-0.5B
Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, codefuse-ai/C2LLM-0.5B est un modèle d’embedding dense de 497 millions de paramètres. Fondé sur Qwen2.5-Coder, il produit des vecteurs de 896 dimensions et emploie PMA, un pooling par attention multi-tête.
Publié par codefuse-ai le 22 décembre 2025 sous licence ouverte Apache 2.0, codefuse-ai/C2LLM-0.5B est un modèle d’embedding dense de 497 millions de paramètres. Fondé sur Qwen2.5-Coder, il produit des vecteurs de 896 dimensions et emploie PMA, un pooling par attention multi-tête.
Affiné sur 3 millions de paires requête-document, il représente des requêtes textuelles et du code pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Il couvre les tâches Text2Code, Code2Code et Code2Text, avec une instruction personnalisable, via Hugging Face Transformers ou Sentence-Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 22 décembre 2025 |
| Dimension du vecteur | 896 |
| Représentation | dense |
| Paramètres | 497 millions |
| Paramètres actifs | 497 millions |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 74,5 % | 15ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 75,5 % | 15ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: CoREB | 58,1 % | 9ᵉ / 19 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Code
Notre analyse
Forces. Les résultats MTEB placent ses aptitudes principales dans la recherche de code et la recherche d’information parmi plusieurs langages de programmation et types de tâches. Les tracks Code et Code Information Retrieval affichent ses meilleurs résultats, tandis que son classement dans le top 10 de CoREB confirme un intérêt pour les correspondances entre texte et code, entre fragments de code, ainsi que pour le reranking. Le pooling PMA vise une agrégation plus élaborée que le mean pooling ou l’utilisation du dernier token. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement.
Limites et points d'attention. Le résultat CoREB reste sensiblement inférieur à ceux des deux tracks centrés sur le retrieval, ce qui signale une efficacité moins homogène lorsque l’évaluation combine embeddings, reranking et plusieurs directions de correspondance. Ses classements sur Code et Code Information Retrieval le situent derrière les modèles de tête de ces évaluations. Les vecteurs denses de 896 dimensions imposent par ailleurs un volume d’indexation et un coût de recherche à prendre en compte à grande échelle. Les usages pertinents sont la recherche de code, le RAG sur des dépôts logiciels, la détection de similarités et le regroupement de fragments apparentés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).