BAAI/bge-base-zh-v1.5

BAAI/bge-base-zh-v1.5 est un modèle d’embedding dense de 109 millions de paramètres publié par BAAI le 11 septembre 2023 sous licence ouverte MIT. Destiné au chinois, il produit des vecteurs de 768 dimensions et peut fonctionner avec ou sans instruction.

BAAI/bge-base-zh-v1.5 est un modèle d’embedding dense de 109 millions de paramètres publié par BAAI le 11 septembre 2023 sous licence ouverte MIT. Destiné au chinois, il produit des vecteurs de 768 dimensions et peut fonctionner avec ou sans instruction.

Le modèle transforme les textes en représentations numériques exploitables pour la recherche sémantique, le RAG, la classification et le clustering. Pour retrouver des passages longs à partir de requêtes courtes, une instruction en chinois peut être ajoutée aux seules requêtes afin d’orienter la représentation.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie11 septembre 2023
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal21,5 %187ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare13,6 %88ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance34,9 %82ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French6,4 %171ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German8,8 %181ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
bisectgroup/BiCA-base54 %
▶ BAAI/bge-base-zh-v1.535 %

MTEB: RTEB Legal

consciousAI/cai-lunaris…22 %
▶ BAAI/bge-base-zh-v1.521 %

Notre analyse

Forces. Parmi les évaluations RTEB fournies, le domaine financier constitue son meilleur terrain relatif, devant le juridique et la santé. Sa spécialisation chinoise et la possibilité d’ajouter une instruction uniquement aux requêtes conviennent aux systèmes de recherche asymétrique associant une question courte à des passages plus développés. Les vecteurs denses de 768 dimensions permettent de contenir la taille des index par rapport à des représentations plus dimensionnelles. La licence MIT facilite l’auto-hébergement, l’intégration et l’adaptation dans des applications commerciales.

Limites et points d'attention. Les classements RTEB restent faibles, y compris en finance, et deviennent particulièrement défavorables en juridique et en santé. Les résultats en allemand et surtout en français placent également le modèle dans le bas des classements correspondants, ce qui limite son intérêt hors du chinois. Sorti en 2023, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents de même catégorie et susceptible de ne plus figurer dans les catalogues actuels. Usages pertinents : recherche sémantique, RAG et clustering de corpus chinois lorsque l’auto-hébergement et une licence permissive sont prioritaires.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).