BAAI/bge-base-en

Publié par BAAI le 5 août 2023, BAAI/bge-base-en est un modèle d’embedding anglophone de 109 millions de paramètres. Il produit des représentations denses de 768 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré avec FlagEmbedding,…

Publié par BAAI le 5 août 2023, BAAI/bge-base-en est un modèle d’embedding anglophone de 109 millions de paramètres. Il produit des représentations denses de 768 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré avec FlagEmbedding, Sentence-Transformers, LangChain ou Hugging Face Transformers.

Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, à la classification et au clustering. Pour la recherche de passages, les requêtes doivent être préfixées par « Represent this sentence for searching relevant passages: », tandis que les passages restent sans instruction.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie5 août 2023
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR53,0 %64ᵉ / 192mteb✅ Mesuré
MTEB: RTEB Legal31,2 %132ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare42,0 %66ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance53,6 %62ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French20,5 %127ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,2 %135ᵉ / 209mteb✅ Mesuré
MTEB: Chemical69,2 %25ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les textes du domaine chimique, où le modèle se situe dans la partie supérieure du classement. Sur BEIR, ses performances en recherche zero-shot sur des tâches et domaines hétérogènes restent également solides au regard de son rang. Ses vecteurs denses de 768 dimensions offrent un format relativement compact pour constituer des index sémantiques, tandis que la licence MIT facilite l’auto-hébergement et l’intégration dans des chaînes RAG.

Limites et points d’attention. Les évaluations spécialisées sont moins convaincantes en finance et en santé, où le modèle apparaît dans la partie basse des classements. Le juridique est une faiblesse plus marquée, tout comme la recherche en français. Conçu pour l’anglais, il convient mal aux corpus francophones ou multilingues. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, les modèles de cette période étant souvent retirés des catalogues. Usages pertinents : recherche sémantique et RAG sur des corpus anglais, classification, similarité et clustering, notamment lorsque l’auto-hébergement sous licence MIT est recherché.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).