Lajavaness/bilingual-embedding-base

Lajavaness/bilingual-embedding-base est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 26 juin 2024 sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres actifs et produit des représentations vectorielles denses de 768…

Lajavaness/bilingual-embedding-base est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 26 juin 2024 sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres actifs et produit des représentations vectorielles denses de 768 dimensions.

Le modèle transforme les phrases en vecteurs normalisés afin d’en mesurer la proximité sémantique. Entraîné sur des données NLI françaises et anglaises, puis affiné sur STSB-fr, STSB-en et des données augmentées avec SBERT, il cible la recherche sémantique, l’indexation pour le RAG, la similarité entre textes et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurLajavaness
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie26 juin 2024
Dimension du vecteur768
Représentationdense
Paramètres278 millions
Paramètres actifs278 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR43,8 %133ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval40,6 %66ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal38,5 %83ᵉ / 208mteb✅ Mesuré
MTEB: Medical50,6 %45ᵉ / 158mteb✅ Mesuré
MTEB: Legal49,0 %45ᵉ / 157mteb✅ Mesuré
MTEB: European58,2 %28ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French40,0 %74ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German45,4 %69ᵉ / 209mteb✅ Mesuré
MTEB: Indic66,6 %13ᵉ / 119mteb✅ Mesuré
MTEB: Korean66,4 %16ᵉ / 102mteb✅ Mesuré
MTEB: French58,8 %24ᵉ / 117mteb✅ Mesuré
MTEB: Russian58,2 %33ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Lajavaness/bilingual-em…44 %
brahmairesearch/slx-v0.142 %

MTEB: Long-context Retrieval

manveertamber/cadet-emb…42 %
▶ Lajavaness/bilingual-em…41 %
w601sxs/b1ade-embed40 %

Notre analyse

Forces. Les résultats MTEB montrent une aptitude multilingue qui dépasse son positionnement français-anglais initial. Ses classements les plus favorables concernent les évaluations Indic et Korean, couvrant notamment la classification, la recherche, le reranking et le bitext mining. Le modèle obtient aussi un rang relativement favorable en allemand. Le pooling moyen des tokens, suivi d’une normalisation, produit des vecteurs directement exploitables pour comparer ou regrouper des textes. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Les performances sont inégales selon les langues : le positionnement recule sur les tracks French, European et surtout Russian, tandis que le score absolu le plus faible parmi les évaluations indiquées concerne German. Avec 278 millions de paramètres, le modèle demande davantage de ressources qu’un encodeur plus petit, et ses vecteurs denses de 768 dimensions alourdissent l’index par rapport à des représentations plus courtes. Sorti en 2024, il appartient désormais à une génération ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible de ne plus figurer dans les catalogues actifs. Usages pertinents : recherche sémantique bilingue, RAG français-anglais, détection de similarité et clustering de textes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).