ibm-granite/granite-vision-3.3-2b-embedding

Publié par IBM le 11 juin 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-vision-3.3-2b-embedding est un modèle d’embedding multimodal de 3 milliards de paramètres. Fondé sur Granite Vision et l’approche ColPali, il projette ses représentations en vecteurs compacts de dimension…

Publié par IBM le 11 juin 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-vision-3.3-2b-embedding est un modèle d’embedding multimodal de 3 milliards de paramètres. Fondé sur Granite Vision et l’approche ColPali, il projette ses représentations en vecteurs compacts de dimension 128.

Le modèle indexe directement des images PNG ou JPEG de documents, notamment des tableaux, graphiques, infographies et mises en page complexes, sans extraction de texte par OCR. Il produit 729 vecteurs par image et calcule leur similarité par interaction tardive MaxSim. Il cible la recherche sémantique visuelle et le retrieval pour le RAG, seul ou associé à un retriever textuel, avec des instructions en anglais.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIBM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie11 juin 2025
Dimension du vecteur128
Représentationmulti-vecteur de style ColBERT
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max128 000 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)77,7 %32ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ ibm-granite/granite-vis…78 %
eagerworks/eager-embed-…77 %

Notre analyse

Forces. Sa spécialisation porte sur la recherche visuelle dans des documents variés et complexes. L’approche multi-vecteur de style ColBERT préserve des représentations locales, puis MaxSim rapproche finement les éléments d’une requête et ceux d’une page. Cette architecture convient aux contenus dont le sens dépend de la structure visuelle, comme les tableaux, graphiques et infographies. Sur ViDoRe V1&V2, le résultat confirme une capacité réelle en visual document retrieval, même si son classement ne le place pas parmi les références de l’évaluation. La dimension 128 limite la taille de chaque vecteur, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration commerciale.

Limites et points d’attention. La production de 729 vecteurs par image réduit une partie du gain associé à leur dimension compacte : un index multi-vecteur reste plus volumineux et MaxSim plus coûteux qu’une recherche fondée sur un vecteur unique par document. Les instructions acceptées sont en anglais. Avec environ un an d’ancienneté, durée très longue à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée par des solutions plus récentes et souvent retirée du catalogue de l’éditeur. Usages pertinents : retrieval visuel de documents complexes et RAG documentaire sans OCR.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).