openbmb/MiniCPM-Embedding
Publié par OpenBMB le 4 septembre 2024, openbmb/MiniCPM-Embedding est un modèle dense de 3 milliards de paramètres, tous actifs. Bilingue chinois-anglais, il produit des vecteurs de 2 304 dimensions à partir de séquences limitées à 512 tokens.
Publié par OpenBMB le 4 septembre 2024, openbmb/MiniCPM-Embedding est un modèle dense de 3 milliards de paramètres, tous actifs. Bilingue chinois-anglais, il produit des vecteurs de 2 304 dimensions à partir de séquences limitées à 512 tokens.
Le modèle sert à indexer et rapprocher des textes pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Il prend aussi en charge la recherche interlingue entre le chinois et l’anglais. Son architecture associe attention bidirectionnelle et Weighted Mean Pooling.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OpenBMB |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 4 septembre 2024 |
| Dimension du vecteur | 2 304 |
| Représentation | dense |
| Paramètres | 3 milliards |
| Paramètres actifs | 3 milliards |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 58,6 % | 18ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. MiniCPM-Embedding se distingue principalement en recherche documentaire généraliste. Son classement dans BEIR le place parmi les modèles solides de sa période pour la récupération zero-shot sur des tâches et domaines hétérogènes. Son fonctionnement bilingue couvre la recherche en chinois et en anglais, ainsi que les correspondances interlingues entre ces langues. Les requêtes peuvent intégrer des instructions ou être traitées sans instruction, tandis que les documents restent en texte brut, ce qui offre deux modes d’utilisation sans modifier le format du corpus.
Limites et points d'attention. La fenêtre de 512 tokens impose de découper les documents longs avant leur indexation, avec un risque de fragmenter leur contexte. Les vecteurs de 2 304 dimensions produisent des index plus volumineux et rendent la recherche plus coûteuse que des représentations plus compactes. Les 3 milliards de paramètres actifs alourdissent également l’exécution. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, le modèle est probablement dépassé par des embeddings plus récents et correspond surtout à l’état du marché de 2024. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des corpus chinois, anglais ou bilingues composés de passages courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).