ibm-granite/granite-vision-3.3-2b-embedding
Publié par IBM le 11 juin 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-vision-3.3-2b-embedding est un modèle d’embedding multimodal de 3 milliards de paramètres. Fondé sur Granite Vision et l’approche ColPali, il projette ses représentations en vecteurs compacts de dimension…
Publié par IBM le 11 juin 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-vision-3.3-2b-embedding est un modèle d’embedding multimodal de 3 milliards de paramètres. Fondé sur Granite Vision et l’approche ColPali, il projette ses représentations en vecteurs compacts de dimension 128.
Le modèle indexe directement des images PNG ou JPEG de documents, notamment des tableaux, graphiques, infographies et mises en page complexes, sans extraction de texte par OCR. Il produit 729 vecteurs par image et calcule leur similarité par interaction tardive MaxSim. Il cible la recherche sémantique visuelle et le retrieval pour le RAG, seul ou associé à un retriever textuel, avec des instructions en anglais.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 11 juin 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur de style ColBERT |
| Paramètres | 3 milliards |
| Paramètres actifs | 3 milliards |
| Longueur de séquence max | 128 000 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 77,7 % | 32ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
Notre analyse
Forces. Sa spécialisation porte sur la recherche visuelle dans des documents variés et complexes. L’approche multi-vecteur de style ColBERT préserve des représentations locales, puis MaxSim rapproche finement les éléments d’une requête et ceux d’une page. Cette architecture convient aux contenus dont le sens dépend de la structure visuelle, comme les tableaux, graphiques et infographies. Sur ViDoRe V1&V2, le résultat confirme une capacité réelle en visual document retrieval, même si son classement ne le place pas parmi les références de l’évaluation. La dimension 128 limite la taille de chaque vecteur, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration commerciale.
Limites et points d’attention. La production de 729 vecteurs par image réduit une partie du gain associé à leur dimension compacte : un index multi-vecteur reste plus volumineux et MaxSim plus coûteux qu’une recherche fondée sur un vecteur unique par document. Les instructions acceptées sont en anglais. Avec environ un an d’ancienneté, durée très longue à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée par des solutions plus récentes et souvent retirée du catalogue de l’éditeur. Usages pertinents : retrieval visuel de documents complexes et RAG documentaire sans OCR.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).