BAAI/bge-small-en-v1.5
BAAI/bge-small-en-v1.5 est un modèle d’embedding anglophone publié par BAAI le 12 septembre 2023. Ses 33 millions de paramètres produisent des représentations denses de 512 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des applications commerciales.
BAAI/bge-small-en-v1.5 est un modèle d’embedding anglophone publié par BAAI le 12 septembre 2023. Ses 33 millions de paramètres produisent des représentations denses de 512 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des applications commerciales.
Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. La version 1.5 accepte les requêtes avec ou sans instruction et vise une distribution plus équilibrée des scores de similarité.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 12 septembre 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,7 % | 80ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 32,1 % | 115ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,9 % | 140ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 39,2 % | 71ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 50,9 % | 70ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 39,0 % | 82ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 38,2 % | 93ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,1 % | 88ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 17,3 % | 140ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 11,7 % | 168ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 69,2 % | 26ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 48,5 % | 69ᵉ / 117 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur positionnement relatif du modèle sur MTEB concerne les textes du domaine chimique, avec des tâches couvrant notamment la classification, le clustering et l’alignement de textes. Sur BEIR, ses résultats indiquent une capacité intermédiaire en recherche zero-shot sur des domaines et tâches variés. Son format compact, avec 33 millions de paramètres et des vecteurs de 512 dimensions, limite la taille des index par rapport à des représentations plus larges. La licence MIT facilite l’auto-hébergement et la réutilisation. Pour rechercher de longs documents à partir de requêtes courtes, l’instruction « Represent this sentence for searching relevant passages: » s’ajoute uniquement aux requêtes, jamais aux passages.
Limites et points d'attention. Conçu pour l’anglais, le modèle se classe plus modestement sur les tracks French, European et Dutch de MTEB. Son positionnement est également intermédiaire sur RTEB Finance, ce qui invite à valider sa pertinence avant un déploiement spécialisé en finance. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique anglophone, RAG avec récupération de passages, détection de similarité et clustering lorsque la compacité de l’index et l’auto-hébergement sont prioritaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).