lightonai/LateOn-Code-edge-pretrain

Publié par lightonai le 12 février 2026 sous licence ouverte Apache 2.0, lightonai/LateOn-Code-edge-pretrain est un modèle d’embedding de 17 millions de paramètres actifs. Dérivé de mixedbread-ai/mxbai-edge-colbert-v0-17m et préentraîné selon la méthodologie CoRNStack, il adopte une…

Publié par lightonai le 12 février 2026 sous licence ouverte Apache 2.0, lightonai/LateOn-Code-edge-pretrain est un modèle d’embedding de 17 millions de paramètres actifs. Dérivé de mixedbread-ai/mxbai-edge-colbert-v0-17m et préentraîné selon la méthodologie CoRNStack, il adopte une architecture ColBERT à interaction tardive.

Le modèle représente phrases et paragraphes par des séquences de vecteurs denses de dimension 48, comparées avec l’opérateur MaxSim. Orienté vers l’anglais et la recherche de code dans plusieurs langages de programmation, il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie12 février 2026
Dimension du vecteur48
Représentationmulti-vecteur dense (ColBERT à interaction tardive)
Paramètres17 millions
Paramètres actifs17 millions
Longueur de séquence max7 999 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval54,0 %36ᵉ / 49mteb✅ Mesuré
MTEB: Code57,5 %30ᵉ / 43mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Code Information Retrieval

▶ lightonai/LateOn-Code-e…54 %

MTEB: Code

▶ lightonai/LateOn-Code-e…57 %
w601sxs/b1ade-embed54 %

Notre analyse

Forces. La spécialisation porte sur la recherche de code en Python, PHP, Go, Ruby, JavaScript et Java. Parmi les deux évaluations MTEB disponibles, le track Code constitue son résultat le plus favorable, ce qui indique une meilleure aptitude relative à retrouver des passages pertinents dans des corpus couvrant plusieurs langages de programmation. L’architecture multi-vecteur préserve des représentations fines au niveau des tokens, puis MaxSim agrège leurs correspondances lors de la comparaison. La dimension 48 rend chaque vecteur individuel compact. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des systèmes ouverts. PyLate et FastPLAID prennent en charge l’indexation et la recherche, tandis qu’un mode de reranking fonctionne sans construire d’index.

Limites et points d'attention. Les classements MTEB placent le modèle dans la partie basse des participants sur Code et Code Information Retrieval, ce dernier étant son track le plus faible. Sa spécialisation concerne l’anglais et six langages de programmation déclarés, plutôt que la recherche généraliste ou largement multilingue. L’approche ColBERT produit plusieurs vecteurs par contenu, ce qui peut accroître le volume d’index et le coût de comparaison malgré la faible dimension de chaque vecteur. Usages pertinents : recherche sémantique dans des dépôts logiciels, RAG spécialisé, reranking de résultats, détection de similarités et clustering de fragments de code.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).