VAGOsolutions/SauerkrautLM-ColQwen3-2b-v0.1
Publié par VAGOsolutions le 20 décembre 2025 sous licence ouverte Apache 2.0, SauerkrautLM-ColQwen3-2b-v0.1 est un modèle d’embedding visuel de 2 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-2B, il produit une représentation multi-vecteur composée d’embeddings de 128…
Publié par VAGOsolutions le 20 décembre 2025 sous licence ouverte Apache 2.0, SauerkrautLM-ColQwen3-2b-v0.1 est un modèle d’embedding visuel de 2 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL-2B, il produit une représentation multi-vecteur composée d’embeddings de 128 dimensions.
Le modèle encode directement les images de documents et les requêtes sans OCR, afin d’intégrer la mise en page, les tableaux, les formulaires et les graphiques. Il cible la recherche sémantique, le retrieval pour le RAG, la similarité et le clustering en anglais, allemand, français, espagnol, italien et portugais.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | VAGOsolutions |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 décembre 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur visuelle, embeddings de 128 dimensions |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 81,0 % | 27ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
Notre analyse
Forces. SauerkrautLM-ColQwen3-2b-v0.1 est spécialisé dans la recherche visuelle de documents de types et de domaines variés. Son encodage direct des pages permet de rapprocher une requête de documents en tenant compte de leur structure visuelle, sans dépendre d’une transcription OCR préalable. La prise en charge de six langues favorise les corpus multilingues européens. Les vecteurs de 128 dimensions offrent une représentation compacte, intéressante pour limiter la taille de chaque embedding dans un index. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG.
Limites et points d'attention. Sur ViDoRe V1 et V2, consacré au Visual document retrieval, le modèle atteint 81 % et se classe 27e sur 48, soit une position en seconde moitié du classement plutôt qu’au niveau des meilleures références évaluées. Sa spécialisation porte sur l’appariement entre requêtes et images de documents, non sur la génération de réponses. Usages pertinents : recherche dans des archives numérisées, sélection de pages pour un pipeline RAG, détection de documents similaires et regroupement de formulaires, tableaux ou rapports.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).