BAAI: bge-m3

BAAI: bge-m3 est un modèle d’embedding multilingue de BAAI, publié sous licence ouverte MIT le 18 novembre 2025. Ses 568 millions de paramètres produisent des vecteurs denses de 1 024 dimensions et prennent en charge des séquences allant jusqu’à 8 192 tokens dans plus de 100 langues.

BAAI: bge-m3 est un modèle d’embedding multilingue de BAAI, publié sous licence ouverte MIT le 18 novembre 2025. Ses 568 millions de paramètres produisent des vecteurs denses de 1 024 dimensions et prennent en charge des séquences allant jusqu’à 8 192 tokens dans plus de 100 langues.

Le modèle combine représentation dense, pondération lexicale creuse et représentation multi-vecteur de type ColBERT. Cette architecture sert à la recherche sémantique ou hybride, au RAG, au calcul de similarité et au clustering, sur des phrases comme sur des documents longs.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur1 024
Représentationdense + creuse (sparse/lexicale) + multi-vecteur (ColBERT)
Paramètres568 millions
Paramètres actifs568 millions
Longueur de séquence max8 194 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR-NL44,7 %5ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval59,5 %34ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal44,7 %66ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare55,0 %48ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance57,7 %51ᵉ / 97mteb✅ Mesuré
MTEB: Medical53,6 %39ᵉ / 158mteb✅ Mesuré
MTEB: RTEB French50,1 %44ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German50,4 %56ᵉ / 209mteb✅ Mesuré
MTEB: Chemical69,6 %23ᵉ / 41mteb✅ Mesuré
MTEB: Farsi65,6 %10ᵉ / 30mteb✅ Mesuré
MTEB: Spanish64,8 %15ᵉ / 27mteb✅ Mesuré
MTEB: Thai64,2 %11ᵉ / 28mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,01 $

Prix en dollars US par million de tokens.

Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. BAAI: bge-m3 se distingue surtout par sa polyvalence multilingue et multimode. Sur MTEB, le track Farsi le place dans le top 10, tandis que Russian et Long-context Retrieval affichent des rangs solides. Les résultats en Spanish et Thai confirment une couverture utile au-delà de l’anglais. La combinaison des embeddings denses, des poids lexicaux creux et de ColBERT permet d’organiser une recherche hybride avec un seul modèle. La séquence de 8 192 tokens facilite l’indexation de documents longs, sans imposer l’ajout d’instructions aux requêtes. La licence MIT autorise l’auto-hébergement et l’adaptation.

Limites et points d’attention. Le track Chemical reste dans la seconde moitié du classement malgré son score élevé, et Spanish comme Thai se situent plutôt au milieu de leurs classements respectifs. Les vecteurs de 1 024 dimensions demandent davantage de stockage et de calcul que des représentations plus petites. Les modes creux et multi-vecteurs peuvent encore alourdir les index et la recherche. Le tarif minimal de 0,01 $ par million de tokens se situe dans la moyenne annoncée, tout en restant 78 % sous la moyenne des modèles similaires. Usages pertinents : recherche multilingue ou hybride, RAG documentaire, similarité et clustering de corpus longs.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).