lightonai/LateOn-Code-edge
Publié par lightonai le 12 février 2026, lightonai/LateOn-Code-edge est un modèle d’embedding de 17 millions de paramètres actifs, spécialisé dans l’anglais et la recherche de code. Il produit une représentation multi-vecteur dense dont chaque vecteur compte 48 dimensions. Distribué sous…
Publié par lightonai le 12 février 2026, lightonai/LateOn-Code-edge est un modèle d’embedding de 17 millions de paramètres actifs, spécialisé dans l’anglais et la recherche de code. Il produit une représentation multi-vecteur dense dont chaque vecteur compte 48 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé.
Fondé sur Ettin-17M et ModernBertModel, il applique une architecture ColBERT à interaction tardive avec l’opérateur MaxSim. Il accepte des documents de 2 048 tokens et des requêtes de 256 tokens. Il sert à l’indexation, à la recherche sémantique, au RAG, à la similarité et au clustering, notamment sur des corpus en Go, Java, JavaScript, PHP, Python et Ruby.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 12 février 2026 |
| Dimension du vecteur | 48 |
| Représentation | multi-vecteur dense (ColBERT à interaction tardive) |
| Paramètres | 17 millions |
| Paramètres actifs | 17 millions |
| Longueur de séquence max | 7 999 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 65,0 % | 30ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 66,6 % | 25ᵉ / 43 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Code
Notre analyse
Forces. LateOn-Code-edge cible directement la recherche d’information dans des corpus logiciels couvrant plusieurs langages de programmation. Ses deux évaluations MTEB portent sur la qualité de recherche de code et sur la récupération d’informations à travers des tâches et langages variés, ce qui correspond à sa spécialisation. L’interaction tardive conserve plusieurs vecteurs par entrée et MaxSim établit les correspondances entre requêtes et documents. La dimension de 48 limite la taille de chaque vecteur, tandis que la fenêtre documentaire de 2 048 tokens permet de traiter des contenus relativement longs. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des chaînes d’indexation et de recherche avec PyLate ou FastPLAID.
Limites et points d'attention. Les classements MTEB placent le modèle dans la seconde moitié des modèles évalués sur ses deux tracks, malgré sa spécialisation. Il vise l’anglais et les langages de programmation présents dans ses jeux d’entraînement, plutôt qu’une recherche multilingue générale en langues naturelles. Sa représentation multi-vecteur implique aussi plusieurs vecteurs par document, ce qui peut alourdir l’index et la comparaison par rapport à un embedding à vecteur unique, même avec 48 dimensions. La limite de 256 tokens pour les requêtes restreint les formulations très longues. Usages pertinents : recherche sémantique dans des dépôts logiciels, RAG sur documentation technique, détection de similarités et regroupement de contenus liés au code.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).