lightonai/LateOn-Code-pretrain

Publié le 12 février 2026 par lightonai sous licence ouverte Apache 2.0, lightonai/LateOn-Code-pretrain est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il adopte une architecture PyLate de type ColBERT à interaction tardive.

Publié le 12 février 2026 par lightonai sous licence ouverte Apache 2.0, lightonai/LateOn-Code-pretrain est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il adopte une architecture PyLate de type ColBERT à interaction tardive.

Le modèle représente les contenus en séquences de vecteurs denses de 128 dimensions, puis évalue leur similarité avec MaxSim. Anglophone pour le texte, il est préentraîné sur du code Python, PHP, Go, Ruby, JavaScript et Java. Il cible la recherche sémantique de code, le RAG, le reranking, la similarité et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie12 février 2026
Dimension du vecteur128
Représentationmulti-vecteur dense (ColBERT à interaction tardive)
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval60,5 %32ᵉ / 49mteb✅ Mesuré
MTEB: Code63,8 %27ᵉ / 43mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Code Information Retrieval

▶ lightonai/LateOn-Code-p…61 %

MTEB: Code

▶ lightonai/LateOn-Code-p…64 %
w601sxs/b1ade-embed54 %

Notre analyse

Forces. La spécialisation de lightonai/LateOn-Code-pretrain porte sur la recherche de code dans plusieurs langages de programmation. Son architecture ColBERT conserve une représentation multi-vecteur des phrases et paragraphes, tandis que l’interaction tardive avec MaxSim permet de comparer finement les éléments d’une requête et d’un contenu. Les évaluations MTEB Code et MTEB Code Information Retrieval confirment une aptitude mesurable aux tâches de retrieval, même si le modèle ne figure pas parmi les mieux classés. Les vecteurs de 128 dimensions sont compacts, et la licence Apache 2.0 autorise l’auto-hébergement. L’intégration avec PyLate et FastPLAID couvre l’indexation et la recherche, avec également un mode de reranking sans index.

Limites et points d'attention. Les classements obtenus sur les deux tracks MTEB consacrés au code placent le modèle dans la moitié basse des modèles évalués, ce qui invite à comparer sa pertinence avec d’autres embeddings avant déploiement. La couverture linguistique du texte se limite à l’anglais. Par ailleurs, la représentation multi-vecteur produit une séquence de vecteurs par contenu, ce qui peut alourdir l’index et rendre la recherche plus coûteuse qu’avec un embedding dense à vecteur unique, malgré la dimension compacte. Usages pertinents : recherche sémantique dans des dépôts de code, RAG technique, reranking de résultats, détection de similarités et regroupement de contenus liés au code.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).