BAAI/bge-small-zh-v1.5
Publié par BAAI le 12 septembre 2023 sous licence ouverte MIT, BAAI/bge-small-zh-v1.5 est un modèle d’embedding destiné principalement au chinois. Ses 33 millions de paramètres produisent des vecteurs denses de 512 dimensions, un format compact adapté à la création d’index vectoriels…
Publié par BAAI le 12 septembre 2023 sous licence ouverte MIT, BAAI/bge-small-zh-v1.5 est un modèle d’embedding destiné principalement au chinois. Ses 33 millions de paramètres produisent des vecteurs denses de 512 dimensions, un format compact adapté à la création d’index vectoriels relativement légers.
Le modèle transforme les textes en représentations numériques pour la recherche sémantique, le RAG, la similarité, la classification et le clustering. Il accepte un fonctionnement avec ou sans instruction. Pour retrouver de longs passages depuis des requêtes courtes, une instruction en chinois peut être appliquée uniquement à la requête.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 12 septembre 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 18,0 % | 190ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 7,1 % | 95ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 24,6 % | 90ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 1,6 % | 198ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 6,9 % | 188ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Legal
Notre analyse
Forces. BAAI/bge-small-zh-v1.5 est spécialisé dans les embeddings chinois et couvre plusieurs usages de retrieval, notamment les bases vectorielles associées aux LLM. Parmi les tracks RTEB fournis, son résultat relatif le moins faible concerne la recherche financière, devant ses évaluations juridique, médicale, allemande et française. Ses vecteurs denses de 512 dimensions limitent la taille des index par rapport à des représentations plus larges. La licence MIT facilite aussi l’auto-hébergement, l’adaptation et l’intégration dans des produits commerciaux.
Limites et points d’attention. Les classements RTEB placent le modèle près du bas du tableau dans tous les domaines évalués. Les résultats sont particulièrement faibles en healthcare, en German et surtout en French, tandis que les performances en legal restent également peu compétitives. Sa spécialisation chinoise en fait un choix peu adapté aux corpus français ou allemands. Sorti en 2023, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, voire retiré de certains catalogues actuels. Usages pertinents : prototypes et systèmes auto-hébergés centrés sur le chinois, lorsque la compacité et la licence ouverte priment sur les performances multilingues ou spécialisées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).