BAAI/bge-base-zh-v1.5
BAAI/bge-base-zh-v1.5 est un modèle d’embedding dense de 109 millions de paramètres publié par BAAI le 11 septembre 2023 sous licence ouverte MIT. Destiné au chinois, il produit des vecteurs de 768 dimensions et peut fonctionner avec ou sans instruction.
BAAI/bge-base-zh-v1.5 est un modèle d’embedding dense de 109 millions de paramètres publié par BAAI le 11 septembre 2023 sous licence ouverte MIT. Destiné au chinois, il produit des vecteurs de 768 dimensions et peut fonctionner avec ou sans instruction.
Le modèle transforme les textes en représentations numériques exploitables pour la recherche sémantique, le RAG, la classification et le clustering. Pour retrouver des passages longs à partir de requêtes courtes, une instruction en chinois peut être ajoutée aux seules requêtes afin d’orienter la représentation.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 11 septembre 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 21,5 % | 187ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 13,6 % | 88ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 34,9 % | 82ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 6,4 % | 171ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 8,8 % | 181ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Legal
Notre analyse
Forces. Parmi les évaluations RTEB fournies, le domaine financier constitue son meilleur terrain relatif, devant le juridique et la santé. Sa spécialisation chinoise et la possibilité d’ajouter une instruction uniquement aux requêtes conviennent aux systèmes de recherche asymétrique associant une question courte à des passages plus développés. Les vecteurs denses de 768 dimensions permettent de contenir la taille des index par rapport à des représentations plus dimensionnelles. La licence MIT facilite l’auto-hébergement, l’intégration et l’adaptation dans des applications commerciales.
Limites et points d'attention. Les classements RTEB restent faibles, y compris en finance, et deviennent particulièrement défavorables en juridique et en santé. Les résultats en allemand et surtout en français placent également le modèle dans le bas des classements correspondants, ce qui limite son intérêt hors du chinois. Sorti en 2023, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents de même catégorie et susceptible de ne plus figurer dans les catalogues actuels. Usages pertinents : recherche sémantique, RAG et clustering de corpus chinois lorsque l’auto-hébergement et une licence permissive sont prioritaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).