VAGOsolutions/SauerkrautLM-ColQwen3-4b-v0.1

Publié le 20 décembre 2025 par VAGOsolutions, SauerkrautLM-ColQwen3-4b-v0.1 est un modèle d’embedding visuel de 4 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-4B, il produit des représentations multi-vecteurs de 128 dimensions.

Publié le 20 décembre 2025 par VAGOsolutions, SauerkrautLM-ColQwen3-4b-v0.1 est un modèle d’embedding visuel de 4 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-4B, il produit des représentations multi-vecteurs de 128 dimensions.

Le modèle associe des requêtes textuelles à des images de documents sans recourir à l’OCR, tout en intégrant la mise en page, les tableaux, les formulaires et les graphiques. Il couvre l’anglais, l’allemand, le français, l’espagnol, l’italien et le portugais. Sa licence ouverte Apache 2.0 facilite l’auto-hébergement pour la recherche sémantique, le RAG et le clustering documentaire.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVAGOsolutions
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie20 décembre 2025
Dimension du vecteur128
Représentationmulti-vecteur visuelle, embeddings de 128 dimensions
Paramètres4 milliards
Paramètres actifs4 milliards
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)82,0 %23ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sa spécialité est le retrieval visuel de documents de formats et de domaines variés, évalué par ViDoRe V1 et V2 dans MTEB. Le traitement direct des pages permet de conserver des informations structurelles que des chaînes fondées uniquement sur le texte peuvent perdre, notamment l’organisation des tableaux, des formulaires et des graphiques. La prise en charge de six langues convient aux corpus documentaires multilingues. Les embeddings de 128 dimensions limitent l’espace occupé par chaque vecteur, tandis que la licence Apache 2.0 autorise le déploiement et l’adaptation dans une infrastructure maîtrisée.

Limites et points d’attention. Son résultat ViDoRe le place au milieu du classement communiqué, plutôt que parmi les systèmes de tête. L’approche multi-vecteur peut multiplier le nombre de représentations stockées par document, ce qui atténue le gain apporté par la faible dimension et augmente potentiellement la taille de l’index ainsi que le travail de recherche. Ce modèle d’embedding ne produit pas de réponses textuelles, un système RAG doit donc l’associer à un modèle génératif. Usages pertinents : recherche multilingue dans des documents visuels, indexation de pages complexes, RAG documentaire et regroupement de documents selon leur proximité sémantique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).