BAAI/bge-visualized-m3

Publié par BAAI le 6 juin 2024, BAAI/bge-visualized-m3 est un modèle d’embedding dense de 873 millions de paramètres, tous actifs. Il produit des vecteurs de 1 024 dimensions et se distingue par son évaluation sur des contenus visuels ainsi que sur des associations entre images et textes.

Publié par BAAI le 6 juin 2024, BAAI/bge-visualized-m3 est un modèle d’embedding dense de 873 millions de paramètres, tous actifs. Il produit des vecteurs de 1 024 dimensions et se distingue par son évaluation sur des contenus visuels ainsi que sur des associations entre images et textes.

Ses représentations numériques peuvent alimenter la recherche sémantique, la récupération de contenus pour un système RAG, le calcul de similarité et le clustering. Âgé d’environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et doit être comparé aux modèles contemporains plutôt qu’aux références actuelles.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBAAI
Poids🟢 Poids ouverts
Date de sortie6 juin 2024
Dimension du vecteur1 024
Représentationdense
Paramètres873 millions
Paramètres actifs873 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only52,4 %34ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English46,0 %37ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual43,8 %33ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite39,7 %41ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

▶ BAAI/bge-visualized-m352 %
kakaobrain/align-base51 %

MTEB: Image-Text, English

▶ BAAI/bge-visualized-m346 %

Notre analyse

Forces. Son meilleur résultat MTEB concerne le track Image only, qui réunit des tâches de retrieval, de classification et de clustering. Le modèle conserve aussi une couverture image-texte multilingue évaluée sur 39 langues, ce qui élargit son intérêt au-delà des corpus exclusivement anglophones. La représentation dense de 1 024 dimensions fournit un format directement exploitable dans un index vectoriel pour rapprocher, classer ou regrouper des contenus. Avec 873 millions de paramètres actifs, il s’agit toutefois d’un modèle substantiel plutôt que d’un encodeur minimaliste.

Limites et points d’attention. Les classements MTEB le placent dans la partie basse des quatre tracks communiqués. Image-Text, English et Image-Text, Multilingual restent notamment derrière la majorité des modèles évalués, tandis que Image-Text, Lite affiche son positionnement relatif le plus faible. Même son meilleur track, Image only, ne le place pas parmi les références de tête. Des vecteurs de 1 024 dimensions alourdissent par ailleurs le stockage des index et le coût des recherches par rapport à des représentations moins dimensionnelles. Usages pertinents : recherche, similarité et clustering d’images ou de paires image-texte lorsque cette couverture prime sur l’état de l’art.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).