Lajavaness/bilingual-embedding-small

Lajavaness/bilingual-embedding-small est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 17 juillet 2024. Ses 118 millions de paramètres produisent des vecteurs denses de 384 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et…

Lajavaness/bilingual-embedding-small est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 17 juillet 2024. Ses 118 millions de paramètres produisent des vecteurs denses de 384 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des applications commerciales.

Fondé sur Multilingual-MiniLM-L12-H384 et l’architecture multilingual-e5-small, il applique un pooling moyen puis une normalisation. Il sert à indexer des textes pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Son entraînement combine des données NLI françaises et anglaises, STSB-fr, STSB-en et une augmentation Augmented SBERT.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurLajavaness
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 juillet 2024
Dimension du vecteur384
Représentationdense
Paramètres118 millions
Paramètres actifs118 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval37,1 %92ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal40,1 %79ᵉ / 208mteb✅ Mesuré
MTEB: Medical46,7 %50ᵉ / 158mteb✅ Mesuré
MTEB: Legal49,4 %44ᵉ / 157mteb✅ Mesuré
MTEB: European56,9 %34ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French26,8 %107ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German44,1 %76ᵉ / 209mteb✅ Mesuré
MTEB: Indic65,0 %16ᵉ / 119mteb✅ Mesuré
MTEB: Korean64,1 %17ᵉ / 102mteb✅ Mesuré
MTEB: French58,0 %27ᵉ / 117mteb✅ Mesuré
MTEB: Russian56,4 %36ᵉ / 104mteb✅ Mesuré
MTEB: German52,1 %20ᵉ / 96mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ Lajavaness/bilingual-em…37 %

MTEB: Indic

▶ Lajavaness/bilingual-em…65 %
omarelshehy/arabic-engl…64 %

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les ensembles Indic et Korean, où le modèle se classe dans la partie haute des modèles évalués. Ces parcours couvrent notamment la classification, la recherche, le reranking et le bitext mining, ce qui indique une représentation utile pour plusieurs tâches sémantiques multilingues. Les évaluations French et European restent également exploitables pour la classification, le clustering, la recherche de paires et d’autres comparaisons de textes. La dimension compacte de 384 réduit la taille des index vectoriels et le coût des calculs de similarité. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement, la modification et l’usage commercial.

Limites et points d'attention. Les résultats MTEB sont moins favorables sur les parcours German, Russian et European, où le modèle se situe davantage en milieu de classement. Son entraînement est centré sur le français et l’anglais, malgré des résultats mesurés dans d’autres langues. Avec 118 millions de paramètres, il privilégie la compacité plutôt que la capacité des modèles d’embedding plus imposants. Sorti en juillet 2024, il est ancien à l’échelle rapide de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique bilingue, RAG français-anglais, détection de similarité et clustering avec des index compacts auto-hébergés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).