BAAI/bge-m3-unsupervised

Publié par BAAI le 30 janvier 2024, BAAI/bge-m3-unsupervised est un modèle d’embedding dense de 568 millions de paramètres, distribué sous licence ouverte MIT. Il produit des vecteurs de 1024 dimensions et résulte d’un apprentissage contrastif à partir de bge-m3-retromae.

Publié par BAAI le 30 janvier 2024, BAAI/bge-m3-unsupervised est un modèle d’embedding dense de 568 millions de paramètres, distribué sous licence ouverte MIT. Il produit des vecteurs de 1024 dimensions et résulte d’un apprentissage contrastif à partir de bge-m3-retromae.

Sa couverture de plus de 100 langues et sa fenêtre maximale de 8192 tokens permettent d’encoder aussi bien des phrases que des documents longs. Ces représentations servent à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie30 janvier 2024
Dimension du vecteur1 024
Représentationdense
Paramètres568 millions
Paramètres actifs568 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal46,3 %59ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare46,7 %58ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance56,3 %55ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French44,1 %63ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German60,2 %40ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB German

nvidia/Nemotron-3-Embed…77 %
voyageai/voyage-4-large…77 %
▶ BAAI/bge-m3-unsupervised60 %
Hanno-Labs/dinghy-law-0…59 %

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ BAAI/bge-m3-unsupervised56 %
MongoDB/mdbr-leaf-ir56 %

Notre analyse

Forces. Les résultats MTEB placent surtout le modèle favorablement sur RTEB German, où il figure approximativement dans le premier cinquième du classement pour la recherche couvrant les domaines juridique, médical et commercial. RTEB French et RTEB Legal le situent également dans le premier tiers, ce qui confirme un intérêt pour la récupération multilingue et spécialisée. La séquence de 8192 tokens facilite l’indexation de documents longs sans découpage excessif. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Les positions sur RTEB Finance et RTEB Healthcare se trouvent au-delà de la moitié du classement, avec une compétitivité plus limitée pour ces corpus spécialisés. Les vecteurs de 1024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec près de deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de janvier 2024 est probablement dépassé par des embeddings plus récents, tandis que les variantes de cette période sont souvent retirées des catalogues actifs. Usages pertinents : recherche multilingue, RAG sur documents longs, similarité et clustering, notamment en allemand, en français et dans le domaine juridique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).