vidore/colSmol-256M

Publié par vidore le 22 janvier 2025 sous licence ouverte Apache 2.0, vidore/colSmol-256M est un modèle d’embedding de 256 millions de paramètres, tous actifs. Extension de SmolVLM-Instruct-250M, il produit des représentations multi-vecteurs de type ColBERT en 128 dimensions pour le…

Publié par vidore le 22 janvier 2025 sous licence ouverte Apache 2.0, vidore/colSmol-256M est un modèle d’embedding de 256 millions de paramètres, tous actifs. Extension de SmolVLM-Instruct-250M, il produit des représentations multi-vecteurs de type ColBERT en 128 dimensions pour le texte et les images.

Le modèle est entraîné entièrement en anglais et cible surtout l’indexation de documents visuels, notamment les PDF et les langues à fortes ressources. Son mécanisme d’interaction tardive sert à la recherche sémantique et au retrieval de documents pour le RAG. Ses vecteurs peuvent également alimenter des systèmes de similarité et de clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvidore
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie22 janvier 2025
Dimension du vecteur128
Représentationmulti-vecteur de type ColBERT pour le texte et les images
Paramètres256 millions
Paramètres actifs256 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)66,9 %42ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V321,4 %27ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. vidore/colSmol-256M est spécialisé dans la recherche de documents à partir de caractéristiques visuelles, plutôt que dans le seul encodage de texte. Ses représentations ColBERT conservent plusieurs vecteurs par document et appliquent une interaction tardive, une architecture adaptée à la mise en correspondance fine entre requêtes, textes et images. Sa licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La dimension de 128 reste compacte pour chaque vecteur, même si l’approche multi-vecteur impose d’en stocker plusieurs. Sur MTEB, ViDoRe V1&V2 constitue son track le plus favorable, sans toutefois le placer parmi les meilleurs modèles évalués.

Limites et points d'attention. L’entraînement exclusivement anglophone réduit sa pertinence attendue pour les contenus dans d’autres langues, en particulier celles disposant de peu de ressources. Les résultats sur ViDoRe V3 sont faibles et situent le modèle dans la partie basse du classement pour la recherche au sein de documents d’entreprise multimodaux, notamment financiers. L’architecture multi-vecteur peut aussi alourdir l’index et augmenter le coût de recherche par rapport à une représentation unique. Âgé d’environ un an, ce qui est très long à l’échelle de l’IA, le modèle est probablement dépassé par des solutions plus récentes et peut avoir été retiré du catalogue de l’éditeur. Usages pertinents : recherche visuelle dans des PDF anglophones, RAG documentaire multimodal, similarité et clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).