BAAI/bge-small-zh-v1.5

Publié par BAAI le 12 septembre 2023 sous licence ouverte MIT, BAAI/bge-small-zh-v1.5 est un modèle d’embedding destiné principalement au chinois. Ses 33 millions de paramètres produisent des vecteurs denses de 512 dimensions, un format compact adapté à la création d’index vectoriels…

Publié par BAAI le 12 septembre 2023 sous licence ouverte MIT, BAAI/bge-small-zh-v1.5 est un modèle d’embedding destiné principalement au chinois. Ses 33 millions de paramètres produisent des vecteurs denses de 512 dimensions, un format compact adapté à la création d’index vectoriels relativement légers.

Le modèle transforme les textes en représentations numériques pour la recherche sémantique, le RAG, la similarité, la classification et le clustering. Il accepte un fonctionnement avec ou sans instruction. Pour retrouver de longs passages depuis des requêtes courtes, une instruction en chinois peut être appliquée uniquement à la requête.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie12 septembre 2023
Dimension du vecteur512
Représentationdense
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal18,0 %190ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare7,1 %95ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance24,6 %90ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French1,6 %198ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German6,9 %188ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ BAAI/bge-small-zh-v1.525 %

MTEB: RTEB Legal

▶ BAAI/bge-small-zh-v1.518 %
Jaume/gemma-2b-embeddin…17 %

Notre analyse

Forces. BAAI/bge-small-zh-v1.5 est spécialisé dans les embeddings chinois et couvre plusieurs usages de retrieval, notamment les bases vectorielles associées aux LLM. Parmi les tracks RTEB fournis, son résultat relatif le moins faible concerne la recherche financière, devant ses évaluations juridique, médicale, allemande et française. Ses vecteurs denses de 512 dimensions limitent la taille des index par rapport à des représentations plus larges. La licence MIT facilite aussi l’auto-hébergement, l’adaptation et l’intégration dans des produits commerciaux.

Limites et points d’attention. Les classements RTEB placent le modèle près du bas du tableau dans tous les domaines évalués. Les résultats sont particulièrement faibles en healthcare, en German et surtout en French, tandis que les performances en legal restent également peu compétitives. Sa spécialisation chinoise en fait un choix peu adapté aux corpus français ou allemands. Sorti en 2023, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, voire retiré de certains catalogues actuels. Usages pertinents : prototypes et systèmes auto-hébergés centrés sur le chinois, lorsque la compacité et la licence ouverte priment sur les performances multilingues ou spécialisées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).