Lajavaness/bilingual-embedding-base
Lajavaness/bilingual-embedding-base est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 26 juin 2024 sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres actifs et produit des représentations vectorielles denses de 768…
Lajavaness/bilingual-embedding-base est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 26 juin 2024 sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres actifs et produit des représentations vectorielles denses de 768 dimensions.
Le modèle transforme les phrases en vecteurs normalisés afin d’en mesurer la proximité sémantique. Entraîné sur des données NLI françaises et anglaises, puis affiné sur STSB-fr, STSB-en et des données augmentées avec SBERT, il cible la recherche sémantique, l’indexation pour le RAG, la similarité entre textes et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Lajavaness |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 26 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 278 millions |
| Paramètres actifs | 278 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 43,8 % | 133ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 40,6 % | 66ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 38,5 % | 83ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 50,6 % | 45ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 49,0 % | 45ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 58,2 % | 28ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 40,0 % | 74ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 45,4 % | 69ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 66,6 % | 13ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Korean | 66,4 % | 16ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: French | 58,8 % | 24ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Russian | 58,2 % | 33ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB montrent une aptitude multilingue qui dépasse son positionnement français-anglais initial. Ses classements les plus favorables concernent les évaluations Indic et Korean, couvrant notamment la classification, la recherche, le reranking et le bitext mining. Le modèle obtient aussi un rang relativement favorable en allemand. Le pooling moyen des tokens, suivi d’une normalisation, produit des vecteurs directement exploitables pour comparer ou regrouper des textes. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d’attention. Les performances sont inégales selon les langues : le positionnement recule sur les tracks French, European et surtout Russian, tandis que le score absolu le plus faible parmi les évaluations indiquées concerne German. Avec 278 millions de paramètres, le modèle demande davantage de ressources qu’un encodeur plus petit, et ses vecteurs denses de 768 dimensions alourdissent l’index par rapport à des représentations plus courtes. Sorti en 2024, il appartient désormais à une génération ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible de ne plus figurer dans les catalogues actifs. Usages pertinents : recherche sémantique bilingue, RAG français-anglais, détection de similarité et clustering de textes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).