BAAI/bge-large-zh-v1.5

BAAI/bge-large-zh-v1.5 est un modèle d’embedding dense de BAAI, publié le 12 septembre 2023 sous licence ouverte MIT. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions. Conçu pour le chinois, il cible notamment la recherche de passages.

BAAI/bge-large-zh-v1.5 est un modèle d’embedding dense de BAAI, publié le 12 septembre 2023 sous licence ouverte MIT. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions. Conçu pour le chinois, il cible notamment la recherche de passages.

Le modèle transforme les textes en représentations numériques utilisables pour la recherche sémantique, l’indexation d’un système RAG, la mesure de similarité et le clustering. La version 1.5 ajuste la distribution des similarités et améliore la recherche sans instruction. Pour associer des requêtes courtes à des documents longs, l’instruction chinoise prévue s’ajoute à la requête, jamais aux passages.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie12 septembre 2023
Dimension du vecteur1 024
Représentationdense
Paramètres335 millions
Paramètres actifs335 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal22,1 %181ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare15,0 %84ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance36,5 %80ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French5,4 %175ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German6,8 %189ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
bisectgroup/BiCA-base54 %
▶ BAAI/bge-large-zh-v1.537 %

MTEB: RTEB Legal

bigscience/sgpt-bloom-7…23 %
▶ BAAI/bge-large-zh-v1.522 %
consciousAI/cai-lunaris…22 %

Notre analyse

Forces. Parmi les tracks RTEB fournis, Finance constitue son résultat relatif le plus solide, devant Legal et Healthcare, ce qui oriente davantage le modèle vers la recherche documentaire financière que vers les corpus médicaux ou juridiques évalués. Sa spécialisation dans le chinois et la recherche de passages répond aux besoins de rapprochement entre requêtes et documents. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales. La représentation dense de 1 024 dimensions fournit des embeddings directement exploitables dans un index vectoriel.

Limites et points d’attention. Les classements RTEB restent bas sur Finance, Healthcare et Legal, malgré l’avantage relatif du premier domaine. Les résultats sont particulièrement faibles en allemand et en français, ce qui limite son intérêt pour la recherche multilingue dans ces langues. Les vecteurs de 1 024 dimensions alourdissent le stockage des index et augmentent le coût des calculs de similarité par rapport à des représentations moins dimensionnées. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée par des embeddings plus récents et souvent retirée des catalogues actifs. Usages pertinents : recherche sémantique et RAG en chinois, notamment pour la recherche de passages, après validation sur le corpus ciblé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).