manu/bge-m3-custom-fr

Publié par manu le 11 avril 2024, manu/bge-m3-custom-fr est un modèle d’embedding Sentence-Transformers de 568 millions de paramètres actifs. Dérivé du modèle dense BGE M3 par fine-tuning sur des données françaises et anglaises, il s’appuie sur XLM-RoBERTa, un pooling du jeton CLS et une…

Publié par manu le 11 avril 2024, manu/bge-m3-custom-fr est un modèle d’embedding Sentence-Transformers de 568 millions de paramètres actifs. Dérivé du modèle dense BGE M3 par fine-tuning sur des données françaises et anglaises, il s’appuie sur XLM-RoBERTa, un pooling du jeton CLS et une normalisation.

Le modèle produit des vecteurs denses de 1024 dimensions et traite jusqu’à 8192 jetons. Il sert à indexer des contenus bilingues pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering, notamment sur des documents longs.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurmanu
Poids🟢 Poids ouverts
Date de sortie11 avril 2024
Dimension du vecteur1 024
Représentationdense
Paramètres568 millions
Paramètres actifs568 millions
Longueur de séquence max8 194 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval57,4 %37ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal43,5 %69ᵉ / 208mteb✅ Mesuré
MTEB: Medical49,0 %46ᵉ / 158mteb✅ Mesuré
MTEB: Legal55,1 %29ᵉ / 157mteb✅ Mesuré
MTEB: European58,9 %24ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French41,2 %68ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German55,5 %50ᵉ / 209mteb✅ Mesuré
MTEB: French54,6 %37ᵉ / 117mteb✅ Mesuré
MTEB: Dutch53,5 %34ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les évaluations MTEB montrent son meilleur positionnement sur European, ce qui souligne son intérêt pour les tâches multilingues de classification et de rapprochement de textes. Long-context Retrieval confirme une aptitude utile à retrouver des informations dans des contenus étendus, cohérente avec sa fenêtre de 8192 jetons. Le modèle reste également compétitif sur Legal et RTEB German, qui couvrent notamment les documents juridiques ainsi que des contenus liés à la santé et aux entreprises. Le fine-tuning en français et en anglais cible directement les corpus bilingues.

Limites et points d'attention. Les résultats French et Dutch sont plus modestes que son score European global, tandis que ses rangs MTEB restent éloignés des toutes premières places. Les vecteurs denses de 1024 dimensions augmentent le volume des index et le coût de calcul de la recherche par rapport à des représentations plus petites. Sorti il y a près de deux ans, une ancienneté très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles plus récents et souvent retirée des catalogues. Usages pertinents : recherche sémantique, RAG et clustering de corpus français-anglais, y compris sur des documents longs ou spécialisés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).