VAGOsolutions/SauerkrautLM-ColQwen3-8b-v0.1
Publié par VAGOsolutions le 20 décembre 2025 sous licence ouverte Apache 2.0, SauerkrautLM-ColQwen3-8b-v0.1 est un modèle d’embedding visuel de 8 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-8B, il représente images et requêtes sous forme de plusieurs vecteurs de 128…
Publié par VAGOsolutions le 20 décembre 2025 sous licence ouverte Apache 2.0, SauerkrautLM-ColQwen3-8b-v0.1 est un modèle d’embedding visuel de 8 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-8B, il représente images et requêtes sous forme de plusieurs vecteurs de 128 dimensions.
Le modèle traite directement les documents sans OCR, avec une résolution dynamique atteignant 1 540 jetons visuels par image. Entraîné en anglais, allemand, français, espagnol, italien et portugais, il cible la recherche sémantique de documents, le RAG multimodal, la mesure de similarité et le clustering, en tenant compte de la mise en page, des tableaux, des formulaires et des graphiques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | VAGOsolutions |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 décembre 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur visuelle, avec embeddings de 128 dimensions |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 82,9 % | 19ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
Notre analyse
Forces. Sa spécialisation porte sur le retrieval visuel à travers des types de documents et des domaines variés. Son résultat sur ViDoRe V1 et V2 le place dans la première moitié des modèles évalués, ce qui indique une aptitude solide à retrouver des pages pertinentes à partir d’une requête. Le traitement direct des images conserve des informations de structure que des chaînes fondées uniquement sur le texte peuvent perdre, notamment la disposition, les tableaux, les formulaires et les graphiques. Les embeddings de 128 dimensions restent compacts, tandis que la licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires ou ouverts.
Limites et points d'attention. Son rang sur ViDoRe ne le situe pas parmi les tout premiers du benchmark. L’architecture de 8 milliards de paramètres implique davantage de mémoire et de calcul qu’un encodeur plus petit. La représentation multi-vecteur peut aussi alourdir les index et augmenter le coût de la recherche, malgré la faible dimension de chaque embedding. La limite de 1 540 jetons visuels par image encadre la résolution exploitable pour les pages particulièrement denses. Usages pertinents : recherche multilingue dans des corpus de documents visuels, RAG multimodal, rapprochement de pages similaires et clustering documentaire.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).