BAAI/bge-small-en-v1.5

BAAI/bge-small-en-v1.5 est un modèle d’embedding anglophone publié par BAAI le 12 septembre 2023. Ses 33 millions de paramètres produisent des représentations denses de 512 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des applications commerciales.

BAAI/bge-small-en-v1.5 est un modèle d’embedding anglophone publié par BAAI le 12 septembre 2023. Ses 33 millions de paramètres produisent des représentations denses de 512 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des applications commerciales.

Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. La version 1.5 accepte les requêtes avec ou sans instruction et vise une distribution plus équilibrée des scores de similarité.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie12 septembre 2023
Dimension du vecteur512
Représentationdense
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,7 %80ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval32,1 %115ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal29,9 %140ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare39,2 %71ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance50,9 %70ᵉ / 97mteb✅ Mesuré
MTEB: Medical39,0 %82ᵉ / 158mteb✅ Mesuré
MTEB: Legal38,2 %93ᵉ / 157mteb✅ Mesuré
MTEB: European46,1 %88ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French17,3 %140ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German11,7 %168ᵉ / 209mteb✅ Mesuré
MTEB: Chemical69,2 %26ᵉ / 41mteb✅ Mesuré
MTEB: French48,5 %69ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur positionnement relatif du modèle sur MTEB concerne les textes du domaine chimique, avec des tâches couvrant notamment la classification, le clustering et l’alignement de textes. Sur BEIR, ses résultats indiquent une capacité intermédiaire en recherche zero-shot sur des domaines et tâches variés. Son format compact, avec 33 millions de paramètres et des vecteurs de 512 dimensions, limite la taille des index par rapport à des représentations plus larges. La licence MIT facilite l’auto-hébergement et la réutilisation. Pour rechercher de longs documents à partir de requêtes courtes, l’instruction « Represent this sentence for searching relevant passages: » s’ajoute uniquement aux requêtes, jamais aux passages.

Limites et points d'attention. Conçu pour l’anglais, le modèle se classe plus modestement sur les tracks French, European et Dutch de MTEB. Son positionnement est également intermédiaire sur RTEB Finance, ce qui invite à valider sa pertinence avant un déploiement spécialisé en finance. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique anglophone, RAG avec récupération de passages, détection de similarité et clustering lorsque la compacité de l’index et l’auto-hébergement sont prioritaires.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).