VAGOsolutions/SauerkrautLM-ColMinistral3-3b-v0.1
VAGOsolutions/SauerkrautLM-ColMinistral3-3b-v0.1 est un modèle d’embedding expérimental de VAGOsolutions, publié le 20 décembre 2025 sous licence ouverte Apache 2.0. Ses 4 milliards de paramètres sont tous actifs. Son architecture Ministral associée à l’encodeur visuel Pixtral produit…
VAGOsolutions/SauerkrautLM-ColMinistral3-3b-v0.1 est un modèle d’embedding expérimental de VAGOsolutions, publié le 20 décembre 2025 sous licence ouverte Apache 2.0. Ses 4 milliards de paramètres sont tous actifs. Son architecture Ministral associée à l’encodeur visuel Pixtral produit des représentations multi-vecteurs de style ColPali, composées d’embeddings de 128 dimensions.
Le modèle encode les images de documents et les requêtes textuelles afin de calculer leur similarité sans OCR. Il cible la recherche sémantique et visuelle, la récupération de contexte pour le RAG, la similarité et le clustering. Il traite six langues : anglais, allemand, français, espagnol, italien et portugais.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | VAGOsolutions |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 décembre 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur visuelle de style ColPali, avec embeddings de 128 dimensions |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 71,9 % | 40ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
Notre analyse
Forces. Sa spécialité est la recherche visuelle dans des documents variés, évaluée par ViDoRe V1 et V2 au sein de MTEB. L’analyse directe des pages vise à préserver les informations portées par les mises en page, tableaux, formulaires et graphiques, plutôt que de réduire les documents à du texte extrait par OCR. Le support de six langues favorise les corpus européens multilingues. Les embeddings de 128 dimensions offrent une représentation compacte, susceptible d’alléger les index par rapport à des vecteurs plus larges. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Avec 72 % et un rang de 40e sur 48 sur ViDoRe, le modèle se situe dans la partie basse du classement considéré, malgré sa spécialisation dans la recherche visuelle de documents. Son approche multi-vecteur peut aussi produire plusieurs représentations par document, ce qui atténue en pratique le gain de compacité associé aux 128 dimensions. Son positionnement expérimental appelle donc une validation sur les corpus et mises en page ciblés. Usages pertinents : recherche sémantique dans des documents visuels multilingues, récupération de passages ou de pages pour le RAG, rapprochement de documents et clustering fondé sur leur contenu visuel et textuel.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).