lightonai/mLateOn
Publié par lightonai le 30 juillet 2026, mLateOn est un modèle d’embedding multilingue de 307 millions de paramètres, dont 110 millions actifs. Fondé sur mmBERT-base, il produit des vecteurs de dimension 128 et accepte des requêtes ou documents allant jusqu’à 8 192 tokens.
Publié par lightonai le 30 juillet 2026, mLateOn est un modèle d’embedding multilingue de 307 millions de paramètres, dont 110 millions actifs. Fondé sur mmBERT-base, il produit des vecteurs de dimension 128 et accepte des requêtes ou documents allant jusqu’à 8 192 tokens.
Ses poids ouverts sous licence Apache 2.0 permettent l’auto-hébergement. Son architecture ColBERT représente chaque texte par plusieurs vecteurs et calcule leur proximité avec un score MaxSim. Entraîné en neuf langues avec des paires interlingues, il cible la recherche sémantique multilingue, le RAG, la similarité documentaire et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 30 juillet 2026 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur (ColBERT, interaction tardive avec score MaxSim) |
| Paramètres | 307 millions |
| Paramètres actifs | 110 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 57,6 % | 23ᵉ / 197 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 71,3 % | 21ᵉ / 51 | mteb | ✅ Mesuré |
| MTEB: Code | 73,5 % | 18ᵉ / 45 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Code Information Retrieval
Notre analyse
Forces. mLateOn se distingue surtout en recherche d’information généraliste : son classement BEIR le place dans le haut du tableau sur un ensemble hétérogène de tâches et de domaines. L’entraînement couvre l’anglais, le français, l’allemand, l’italien, l’espagnol, le portugais, le suédois, le norvégien et l’arabe. Le modèle se généralise aussi à des langues et écritures absentes de cet entraînement de recherche. La limite de 8 192 tokens facilite l’indexation de documents longs. La dimension 128 réduit la taille de chaque vecteur, tandis que la licence Apache 2.0 autorise un déploiement auto-hébergé.
Limites et points d’attention. Les résultats MTEB restent en retrait des toutes premières places sur les trois tracks évalués. L’architecture ColBERT produit plusieurs vecteurs par texte : malgré leur dimension compacte, elle peut alourdir l’index et rendre la recherche MaxSim plus exigeante qu’une représentation à vecteur unique. Le clustering demande aussi une stratégie adaptée pour agréger ces représentations multi-vecteurs. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, similarité documentaire et systèmes de recherche auto-hébergés.
Sources des données : MTEB — Massive Text Embedding Benchmark.