lightonai/LateOn-Code-pretrain
Publié le 12 février 2026 par lightonai sous licence ouverte Apache 2.0, lightonai/LateOn-Code-pretrain est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il adopte une architecture PyLate de type ColBERT à interaction tardive.
Publié le 12 février 2026 par lightonai sous licence ouverte Apache 2.0, lightonai/LateOn-Code-pretrain est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il adopte une architecture PyLate de type ColBERT à interaction tardive.
Le modèle représente les contenus en séquences de vecteurs denses de 128 dimensions, puis évalue leur similarité avec MaxSim. Anglophone pour le texte, il est préentraîné sur du code Python, PHP, Go, Ruby, JavaScript et Java. Il cible la recherche sémantique de code, le RAG, le reranking, la similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 12 février 2026 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur dense (ColBERT à interaction tardive) |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 60,5 % | 32ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 63,8 % | 27ᵉ / 43 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Code
Notre analyse
Forces. La spécialisation de lightonai/LateOn-Code-pretrain porte sur la recherche de code dans plusieurs langages de programmation. Son architecture ColBERT conserve une représentation multi-vecteur des phrases et paragraphes, tandis que l’interaction tardive avec MaxSim permet de comparer finement les éléments d’une requête et d’un contenu. Les évaluations MTEB Code et MTEB Code Information Retrieval confirment une aptitude mesurable aux tâches de retrieval, même si le modèle ne figure pas parmi les mieux classés. Les vecteurs de 128 dimensions sont compacts, et la licence Apache 2.0 autorise l’auto-hébergement. L’intégration avec PyLate et FastPLAID couvre l’indexation et la recherche, avec également un mode de reranking sans index.
Limites et points d'attention. Les classements obtenus sur les deux tracks MTEB consacrés au code placent le modèle dans la moitié basse des modèles évalués, ce qui invite à comparer sa pertinence avec d’autres embeddings avant déploiement. La couverture linguistique du texte se limite à l’anglais. Par ailleurs, la représentation multi-vecteur produit une séquence de vecteurs par contenu, ce qui peut alourdir l’index et rendre la recherche plus coûteuse qu’avec un embedding dense à vecteur unique, malgré la dimension compacte. Usages pertinents : recherche sémantique dans des dépôts de code, RAG technique, reranking de résultats, détection de similarités et regroupement de contenus liés au code.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).