VAGOsolutions/SauerkrautLM-ColQwen3-4b-v0.1
Publié le 20 décembre 2025 par VAGOsolutions, SauerkrautLM-ColQwen3-4b-v0.1 est un modèle d’embedding visuel de 4 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-4B, il produit des représentations multi-vecteurs de 128 dimensions.
Publié le 20 décembre 2025 par VAGOsolutions, SauerkrautLM-ColQwen3-4b-v0.1 est un modèle d’embedding visuel de 4 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-4B, il produit des représentations multi-vecteurs de 128 dimensions.
Le modèle associe des requêtes textuelles à des images de documents sans recourir à l’OCR, tout en intégrant la mise en page, les tableaux, les formulaires et les graphiques. Il couvre l’anglais, l’allemand, le français, l’espagnol, l’italien et le portugais. Sa licence ouverte Apache 2.0 facilite l’auto-hébergement pour la recherche sémantique, le RAG et le clustering documentaire.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | VAGOsolutions |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 décembre 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur visuelle, embeddings de 128 dimensions |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 82,0 % | 23ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
Notre analyse
Forces. Sa spécialité est le retrieval visuel de documents de formats et de domaines variés, évalué par ViDoRe V1 et V2 dans MTEB. Le traitement direct des pages permet de conserver des informations structurelles que des chaînes fondées uniquement sur le texte peuvent perdre, notamment l’organisation des tableaux, des formulaires et des graphiques. La prise en charge de six langues convient aux corpus documentaires multilingues. Les embeddings de 128 dimensions limitent l’espace occupé par chaque vecteur, tandis que la licence Apache 2.0 autorise le déploiement et l’adaptation dans une infrastructure maîtrisée.
Limites et points d’attention. Son résultat ViDoRe le place au milieu du classement communiqué, plutôt que parmi les systèmes de tête. L’approche multi-vecteur peut multiplier le nombre de représentations stockées par document, ce qui atténue le gain apporté par la faible dimension et augmente potentiellement la taille de l’index ainsi que le travail de recherche. Ce modèle d’embedding ne produit pas de réponses textuelles, un système RAG doit donc l’associer à un modèle génératif. Usages pertinents : recherche multilingue dans des documents visuels, indexation de pages complexes, RAG documentaire et regroupement de documents selon leur proximité sémantique.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).