vidore/colSmol-500M

Publié par vidore le 22 janvier 2025, colSmol-500M est un modèle d’embedding de 500 millions de paramètres, tous actifs. Cette extension de SmolVLM produit des représentations multi-vecteurs ColBERT de dimension 128 pour le texte et les images. Son entraînement est entièrement en anglais…

Publié par vidore le 22 janvier 2025, colSmol-500M est un modèle d’embedding de 500 millions de paramètres, tous actifs. Cette extension de SmolVLM produit des représentations multi-vecteurs ColBERT de dimension 128 pour le texte et les images. Son entraînement est entièrement en anglais et vise surtout les PDF ainsi que les langues à fortes ressources.

Le modèle sert à indexer des documents selon leur contenu textuel et visuel, puis à comparer une requête textuelle à des images par interaction tardive ColBERT. Il convient à la recherche sémantique, à la récupération documentaire pour le RAG, à la mesure de similarité et au clustering. Sa licence Apache 2.0 autorise l’auto-hébergement et les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvidore
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie22 janvier 2025
Dimension du vecteur128
Représentationmulti-vecteur (ColBERT) pour le texte et les images
Paramètres500 millions
Paramètres actifs500 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)71,2 %41ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. colSmol-500M est spécialisé dans la recherche au sein de documents visuels, notamment les PDF, sans devoir réduire leur contenu à du texte seul. Sa représentation multi-vecteurs conserve des caractéristiques fines du texte et des images, tandis que l’interaction tardive ColBERT calcule la pertinence entre une requête textuelle et les éléments indexés. La dimension 128 limite la taille de chaque vecteur, un avantage pour contenir le poids de l’index, même si chaque document produit plusieurs vecteurs. La licence Apache 2.0 facilite par ailleurs le déploiement sur une infrastructure maîtrisée.

Limites et points d'attention. Sur ViDoRe V1 et V2, consacré à la recherche dans des documents visuels variés, le modèle se situe près du bas du classement, ce qui indique une compétitivité limitée face aux autres systèmes évalués. Son entraînement entièrement anglophone et son ciblage des langues à fortes ressources réduisent son intérêt pour les corpus francophones spécialisés ou les langues moins dotées. L’approche multi-vecteurs alourdit aussi l’index et le calcul de recherche par rapport à une représentation à vecteur unique. Sorti il y a environ un an, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : prototypes auto-hébergés de recherche visuelle sur PDF, RAG documentaire, similarité et clustering de documents principalement anglais.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).