Lajavaness/bilingual-embedding-large
Publié par Lajavaness le 24 juin 2024, Lajavaness/bilingual-embedding-large est un modèle d’embedding bilingue français-anglais de 560 millions de paramètres, fondé sur XLM-RoBERTa. Il produit une représentation dense et normalisée de 1024 dimensions, obtenue par pooling moyen des tokens.
Publié par Lajavaness le 24 juin 2024, Lajavaness/bilingual-embedding-large est un modèle d’embedding bilingue français-anglais de 560 millions de paramètres, fondé sur XLM-RoBERTa. Il produit une représentation dense et normalisée de 1024 dimensions, obtenue par pooling moyen des tokens.
Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé. Ce SentenceTransformer rapproche les phrases françaises et anglaises dans un même espace vectoriel afin d’alimenter la recherche sémantique, la récupération de passages pour le RAG, la mesure de similarité et le clustering de textes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Lajavaness |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 24 juin 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense : vecteur de 1024 dimensions |
| Paramètres | 560 millions |
| Paramètres actifs | 560 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 40,5 % | 69ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 41,2 % | 76ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 53,5 % | 40ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 52,3 % | 38ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 60,6 % | 19ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 39,4 % | 76ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 48,1 % | 60ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 67,4 % | 11ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: French | 62,6 % | 19ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 56,2 % | 23ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 56,0 % | 11ᵉ / 96 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Indic
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les mieux classés sur les tracks Indic et German, avec des positions également solides en French et European. Ce profil indique une bonne aptitude aux traitements multilingues évalués par ces ensembles, notamment la classification, le clustering, la comparaison de paires et le bitext mining selon les tracks. Son entraînement combine SNLI et XNLI en anglais et en français, STSB dans les deux langues, puis une étape Augmented SBERT. La licence Apache 2.0 constitue un atout pratique pour le déploiement et l’adaptation en auto-hébergement.
Limites et points d'attention. Le track Medical est nettement moins bien classé que ses meilleurs résultats multilingues, ce qui le rend moins convaincant pour la recherche d’informations cliniques, biomédicales ou de santé grand public. Les résultats Dutch sont aussi plus modestes que ceux observés sur Indic, German, French et European. Les vecteurs denses de 1024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus petites. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de 2024 est probablement dépassé par des embeddings plus récents et peut ne plus figurer dans les catalogues courants. Usages pertinents : recherche sémantique et clustering bilingues français-anglais, similarité de phrases et récupération de passages pour un pipeline RAG auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).