Lajavaness/bilingual-embedding-small
Lajavaness/bilingual-embedding-small est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 17 juillet 2024. Ses 118 millions de paramètres produisent des vecteurs denses de 384 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et…
Lajavaness/bilingual-embedding-small est un modèle d’embedding bilingue français-anglais publié par Lajavaness le 17 juillet 2024. Ses 118 millions de paramètres produisent des vecteurs denses de 384 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des applications commerciales.
Fondé sur Multilingual-MiniLM-L12-H384 et l’architecture multilingual-e5-small, il applique un pooling moyen puis une normalisation. Il sert à indexer des textes pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Son entraînement combine des données NLI françaises et anglaises, STSB-fr, STSB-en et une augmentation Augmented SBERT.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Lajavaness |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 juillet 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 118 millions |
| Paramètres actifs | 118 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 37,1 % | 92ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 40,1 % | 79ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 46,7 % | 50ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 49,4 % | 44ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 56,9 % | 34ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 26,8 % | 107ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 44,1 % | 76ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 65,0 % | 16ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Korean | 64,1 % | 17ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: French | 58,0 % | 27ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Russian | 56,4 % | 36ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: German | 52,1 % | 20ᵉ / 96 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Indic
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les ensembles Indic et Korean, où le modèle se classe dans la partie haute des modèles évalués. Ces parcours couvrent notamment la classification, la recherche, le reranking et le bitext mining, ce qui indique une représentation utile pour plusieurs tâches sémantiques multilingues. Les évaluations French et European restent également exploitables pour la classification, le clustering, la recherche de paires et d’autres comparaisons de textes. La dimension compacte de 384 réduit la taille des index vectoriels et le coût des calculs de similarité. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement, la modification et l’usage commercial.
Limites et points d'attention. Les résultats MTEB sont moins favorables sur les parcours German, Russian et European, où le modèle se situe davantage en milieu de classement. Son entraînement est centré sur le français et l’anglais, malgré des résultats mesurés dans d’autres langues. Avec 118 millions de paramètres, il privilégie la compacité plutôt que la capacité des modèles d’embedding plus imposants. Sorti en juillet 2024, il est ancien à l’échelle rapide de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique bilingue, RAG français-anglais, détection de similarité et clustering avec des index compacts auto-hébergés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).