manu/bge-m3-custom-fr
Publié par manu le 11 avril 2024, manu/bge-m3-custom-fr est un modèle d’embedding Sentence-Transformers de 568 millions de paramètres actifs. Dérivé du modèle dense BGE M3 par fine-tuning sur des données françaises et anglaises, il s’appuie sur XLM-RoBERTa, un pooling du jeton CLS et une…
Publié par manu le 11 avril 2024, manu/bge-m3-custom-fr est un modèle d’embedding Sentence-Transformers de 568 millions de paramètres actifs. Dérivé du modèle dense BGE M3 par fine-tuning sur des données françaises et anglaises, il s’appuie sur XLM-RoBERTa, un pooling du jeton CLS et une normalisation.
Le modèle produit des vecteurs denses de 1024 dimensions et traite jusqu’à 8192 jetons. Il sert à indexer des contenus bilingues pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering, notamment sur des documents longs.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | manu |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 11 avril 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 568 millions |
| Paramètres actifs | 568 millions |
| Longueur de séquence max | 8 194 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 57,4 % | 37ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 43,5 % | 69ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 49,0 % | 46ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 55,1 % | 29ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 58,9 % | 24ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 41,2 % | 68ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 55,5 % | 50ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 54,6 % | 37ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 53,5 % | 34ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: European
Notre analyse
Forces. Les évaluations MTEB montrent son meilleur positionnement sur European, ce qui souligne son intérêt pour les tâches multilingues de classification et de rapprochement de textes. Long-context Retrieval confirme une aptitude utile à retrouver des informations dans des contenus étendus, cohérente avec sa fenêtre de 8192 jetons. Le modèle reste également compétitif sur Legal et RTEB German, qui couvrent notamment les documents juridiques ainsi que des contenus liés à la santé et aux entreprises. Le fine-tuning en français et en anglais cible directement les corpus bilingues.
Limites et points d'attention. Les résultats French et Dutch sont plus modestes que son score European global, tandis que ses rangs MTEB restent éloignés des toutes premières places. Les vecteurs denses de 1024 dimensions augmentent le volume des index et le coût de calcul de la recherche par rapport à des représentations plus petites. Sorti il y a près de deux ans, une ancienneté très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles plus récents et souvent retirée des catalogues. Usages pertinents : recherche sémantique, RAG et clustering de corpus français-anglais, y compris sur des documents longs ou spécialisés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).