BAAI/bge-small-en

Publié par BAAI le 5 août 2023, BAAI/bge-small-en est un modèle d’embedding dense anglophone. Son nom signifie « BAAI general embedding ». Il compte 33 millions de paramètres, tous actifs, et transforme les textes en vecteurs de 512 dimensions.

Publié par BAAI le 5 août 2023, BAAI/bge-small-en est un modèle d’embedding dense anglophone. Son nom signifie « BAAI general embedding ». Il compte 33 millions de paramètres, tous actifs, et transforme les textes en vecteurs de 512 dimensions.

Distribué sous licence ouverte MIT, ce modèle compact peut être auto-hébergé et intégré à un moteur de recherche sémantique, à un système RAG, à un outil de mesure de similarité ou à une chaîne de clustering. Il sert à retrouver et organiser des contenus, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie5 août 2023
Dimension du vecteur512
Représentationdense
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,8 %78ᵉ / 192mteb✅ Mesuré
MTEB: Chemical68,7 %29ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat MTEB communiqué concerne les textes du domaine Chemical, sur un ensemble couvrant notamment le bitext mining, la classification et le clustering. Le classement obtenu reste toutefois éloigné des premières places. Sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe dans la première moitié du classement. Sa taille de 33 millions de paramètres et ses vecteurs de 512 dimensions permettent de constituer des index relativement compacts. La licence MIT facilite par ailleurs l’auto-hébergement et la réutilisation.

Limites et points d'attention. BAAI/bge-small-en est limité à l’anglais. Sorti il y a environ trois ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Pour la recherche de passages, les requêtes doivent être préfixées par « Represent this sentence for searching relevant passages: », tandis que les passages restent sans instruction. Son apprentissage contrastif utilise une température de 0,01, et l’ordre relatif des scores est plus significatif que leur valeur absolue. Usages pertinents : recherche sémantique anglophone, RAG compact, similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).