lightonai/mLateOn

Publié par lightonai le 30 juillet 2026, mLateOn est un modèle d’embedding multilingue de 307 millions de paramètres, dont 110 millions actifs. Fondé sur mmBERT-base, il produit des vecteurs de dimension 128 et accepte des requêtes ou documents allant jusqu’à 8 192 tokens.

Publié par lightonai le 30 juillet 2026, mLateOn est un modèle d’embedding multilingue de 307 millions de paramètres, dont 110 millions actifs. Fondé sur mmBERT-base, il produit des vecteurs de dimension 128 et accepte des requêtes ou documents allant jusqu’à 8 192 tokens.

Ses poids ouverts sous licence Apache 2.0 permettent l’auto-hébergement. Son architecture ColBERT représente chaque texte par plusieurs vecteurs et calcule leur proximité avec un score MaxSim. Entraîné en neuf langues avec des paires interlingues, il cible la recherche sémantique multilingue, le RAG, la similarité documentaire et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie30 juillet 2026
Dimension du vecteur128
Représentationmulti-vecteur (ColBERT, interaction tardive avec score MaxSim)
Paramètres307 millions
Paramètres actifs110 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR57,6 %23ᵉ / 197mteb✅ Mesuré
MTEB: Code Information Retrieval71,3 %21ᵉ / 51mteb✅ Mesuré
MTEB: Code73,5 %18ᵉ / 45mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ lightonai/mLateOn58 %

MTEB: Code Information Retrieval

Qodo/Qodo-Embed-1-7B71 %
▶ lightonai/mLateOn71 %

Notre analyse

Forces. mLateOn se distingue surtout en recherche d’information généraliste : son classement BEIR le place dans le haut du tableau sur un ensemble hétérogène de tâches et de domaines. L’entraînement couvre l’anglais, le français, l’allemand, l’italien, l’espagnol, le portugais, le suédois, le norvégien et l’arabe. Le modèle se généralise aussi à des langues et écritures absentes de cet entraînement de recherche. La limite de 8 192 tokens facilite l’indexation de documents longs. La dimension 128 réduit la taille de chaque vecteur, tandis que la licence Apache 2.0 autorise un déploiement auto-hébergé.

Limites et points d’attention. Les résultats MTEB restent en retrait des toutes premières places sur les trois tracks évalués. L’architecture ColBERT produit plusieurs vecteurs par texte : malgré leur dimension compacte, elle peut alourdir l’index et rendre la recherche MaxSim plus exigeante qu’une représentation à vecteur unique. Le clustering demande aussi une stratégie adaptée pour agréger ces représentations multi-vecteurs. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, similarité documentaire et systèmes de recherche auto-hébergés.


Sources des données : MTEB — Massive Text Embedding Benchmark.