BAAI/bge-visualized-base
Publié par BAAI le 6 juin 2024, BAAI/bge-visualized-base est un modèle d’embedding dense de 196 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions destinés à représenter des contenus sous une forme numérique comparable.
Publié par BAAI le 6 juin 2024, BAAI/bge-visualized-base est un modèle d’embedding dense de 196 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions destinés à représenter des contenus sous une forme numérique comparable.
Le modèle peut servir à construire des index pour la recherche sémantique et la couche de récupération d’un système RAG, ainsi qu’à mesurer des similarités ou à regrouper des contenus par clustering. Ses évaluations MTEB portent sur l’image seule et sur l’association image-texte, en anglais comme dans un cadre multilingue.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BAAI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 6 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 196 millions |
| Paramètres actifs | 196 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 53,1 % | 33ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 47,4 % | 33ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 41,7 % | 35ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 38,0 % | 44ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Le meilleur résultat mesuré concerne le track MTEB Image only, qui couvre notamment la recherche, la classification et le clustering. Les évaluations Image-Text montrent aussi une capacité à rapprocher images et textes, avec un résultat plus élevé en anglais que dans le track multilingue. La représentation dense de 768 dimensions fournit un format fixe directement exploitable pour l’indexation, le calcul de similarité et le regroupement de contenus. La couverture repose sur deux sources de données concordantes.
Limites et points d’attention. Les rangs MTEB placent le modèle dans la partie basse des classements sur les quatre tracks disponibles. Image-Text, Multilingual reste en retrait par rapport à Image-Text, English, tandis que Image-Text, Lite constitue son résultat relatif le plus faible. Sorti il y a environ deux ans, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des solutions plus récentes de sa catégorie, les modèles de cette période étant aussi souvent retirés des catalogues. Usages pertinents : recherche et clustering d’images, rapprochement image-texte et récupération de contenus dans un pipeline RAG lorsque ses performances mesurées restent suffisantes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).