lightonai/LateOn-Code

Publié par lightonai le 12 février 2026 sous licence ouverte Apache 2.0, LateOn-Code est un modèle d’embedding anglophone de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT-base, il projette ses représentations de 768 vers 128 dimensions.

Publié par lightonai le 12 février 2026 sous licence ouverte Apache 2.0, LateOn-Code est un modèle d’embedding anglophone de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT-base, il projette ses représentations de 768 vers 128 dimensions.

Son architecture ColBERT à interaction tardive produit une séquence de vecteurs denses de 128 dimensions, comparés avec l’opérateur MaxSim. Optimisé pour la recherche de code en anglais, notamment en Go, Java, JavaScript, PHP, Python et Ruby, il vise l’indexation, la recherche sémantique ou hybride et la récupération de contexte pour le RAG.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie12 février 2026
Dimension du vecteur128
Représentationmulti-vecteur dense (ColBERT à interaction tardive)
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval73,4 %18ᵉ / 49mteb✅ Mesuré
MTEB: Code74,1 %17ᵉ / 43mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Code Information Retrieval

▶ lightonai/LateOn-Code73 %

MTEB: Code

▶ lightonai/LateOn-Code74 %
Shuu12121/NightOwl-Code…71 %

Notre analyse

Forces. LateOn-Code obtient des résultats solides dans les deux évaluations MTEB consacrées à la recherche de code, en se plaçant dans la première moitié des modèles testés. Son approche multi-vecteur conserve des représentations distinctes pour les éléments d’une phrase ou d’un paragraphe, tandis que MaxSim permet une interaction fine entre requête et contenu indexé. La projection en 128 dimensions limite la taille de chaque vecteur. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche. Le modèle peut être exploité avec PyLate, FastPLAID et ColGrep.

Limites et points d'attention. Ses classements MTEB restent en retrait des modèles en tête sur les tâches de Code et de Code Information Retrieval. Son optimisation pour l’anglais restreint son positionnement pour les requêtes rédigées dans d’autres langues naturelles. Malgré la dimension compacte de chaque vecteur, la représentation d’un texte par une séquence de vecteurs peut produire un index plus volumineux et une recherche plus coûteuse qu’un embedding dense à vecteur unique. Usages pertinents : recherche sémantique ou hybride dans des dépôts logiciels, récupération de passages pour le RAG et indexation de contenus techniques anglophones.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).