lightonai/LateOn-Code
Publié par lightonai le 12 février 2026 sous licence ouverte Apache 2.0, LateOn-Code est un modèle d’embedding anglophone de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT-base, il projette ses représentations de 768 vers 128 dimensions.
Publié par lightonai le 12 février 2026 sous licence ouverte Apache 2.0, LateOn-Code est un modèle d’embedding anglophone de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT-base, il projette ses représentations de 768 vers 128 dimensions.
Son architecture ColBERT à interaction tardive produit une séquence de vecteurs denses de 128 dimensions, comparés avec l’opérateur MaxSim. Optimisé pour la recherche de code en anglais, notamment en Go, Java, JavaScript, PHP, Python et Ruby, il vise l’indexation, la recherche sémantique ou hybride et la récupération de contexte pour le RAG.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 12 février 2026 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur dense (ColBERT à interaction tardive) |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 73,4 % | 18ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 74,1 % | 17ᵉ / 43 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Code
Notre analyse
Forces. LateOn-Code obtient des résultats solides dans les deux évaluations MTEB consacrées à la recherche de code, en se plaçant dans la première moitié des modèles testés. Son approche multi-vecteur conserve des représentations distinctes pour les éléments d’une phrase ou d’un paragraphe, tandis que MaxSim permet une interaction fine entre requête et contenu indexé. La projection en 128 dimensions limite la taille de chaque vecteur. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche. Le modèle peut être exploité avec PyLate, FastPLAID et ColGrep.
Limites et points d'attention. Ses classements MTEB restent en retrait des modèles en tête sur les tâches de Code et de Code Information Retrieval. Son optimisation pour l’anglais restreint son positionnement pour les requêtes rédigées dans d’autres langues naturelles. Malgré la dimension compacte de chaque vecteur, la représentation d’un texte par une séquence de vecteurs peut produire un index plus volumineux et une recherche plus coûteuse qu’un embedding dense à vecteur unique. Usages pertinents : recherche sémantique ou hybride dans des dépôts logiciels, récupération de passages pour le RAG et indexation de contenus techniques anglophones.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).