BAAI/bge-large-zh-v1.5
BAAI/bge-large-zh-v1.5 est un modèle d’embedding dense de BAAI, publié le 12 septembre 2023 sous licence ouverte MIT. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions. Conçu pour le chinois, il cible notamment la recherche de passages.
BAAI/bge-large-zh-v1.5 est un modèle d’embedding dense de BAAI, publié le 12 septembre 2023 sous licence ouverte MIT. Ses 335 millions de paramètres produisent des vecteurs de 1 024 dimensions. Conçu pour le chinois, il cible notamment la recherche de passages.
Le modèle transforme les textes en représentations numériques utilisables pour la recherche sémantique, l’indexation d’un système RAG, la mesure de similarité et le clustering. La version 1.5 ajuste la distribution des similarités et améliore la recherche sans instruction. Pour associer des requêtes courtes à des documents longs, l’instruction chinoise prévue s’ajoute à la requête, jamais aux passages.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 12 septembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 22,1 % | 181ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 15,0 % | 84ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 36,5 % | 80ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 5,4 % | 175ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 6,8 % | 189ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Legal
Notre analyse
Forces. Parmi les tracks RTEB fournis, Finance constitue son résultat relatif le plus solide, devant Legal et Healthcare, ce qui oriente davantage le modèle vers la recherche documentaire financière que vers les corpus médicaux ou juridiques évalués. Sa spécialisation dans le chinois et la recherche de passages répond aux besoins de rapprochement entre requêtes et documents. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales. La représentation dense de 1 024 dimensions fournit des embeddings directement exploitables dans un index vectoriel.
Limites et points d’attention. Les classements RTEB restent bas sur Finance, Healthcare et Legal, malgré l’avantage relatif du premier domaine. Les résultats sont particulièrement faibles en allemand et en français, ce qui limite son intérêt pour la recherche multilingue dans ces langues. Les vecteurs de 1 024 dimensions alourdissent le stockage des index et augmentent le coût des calculs de similarité par rapport à des représentations moins dimensionnées. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée par des embeddings plus récents et souvent retirée des catalogues actifs. Usages pertinents : recherche sémantique et RAG en chinois, notamment pour la recherche de passages, après validation sur le corpus ciblé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).