VAGOsolutions/SauerkrautLM-ColQwen3-1.7b-Turbo-v0.1
Publié le 20 décembre 2025 par VAGOsolutions, SauerkrautLM-ColQwen3-1.7b-Turbo-v0.1 est un modèle d’embedding visuel de 2 milliards de paramètres, tous actifs. Dérivé de Qwen3-VL-2B par élagage structuré et réduction du FFN, il produit des représentations multi-vecteurs de dimension 128…
Publié le 20 décembre 2025 par VAGOsolutions, SauerkrautLM-ColQwen3-1.7b-Turbo-v0.1 est un modèle d’embedding visuel de 2 milliards de paramètres, tous actifs. Dérivé de Qwen3-VL-2B par élagage structuré et réduction du FFN, il produit des représentations multi-vecteurs de dimension 128 et accepte jusqu’à 262 144 tokens.
Le modèle associe des requêtes textuelles à des images de documents sans OCR, en tenant compte de la mise en page, des tableaux, des formulaires et des graphiques. Évalué sur des tâches multilingues, notamment en anglais et en français, il cible la recherche sémantique, le RAG et le regroupement de documents. Sa licence ouverte Apache 2.0 autorise sa réutilisation et son auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | VAGOsolutions |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 décembre 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur visuel, embeddings de dimension 128 |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 77,9 % | 31ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
Notre analyse
Forces. Spécialisé dans la recherche visuelle de documents, le modèle encode séparément les requêtes textuelles et les pages afin de calculer leur similarité. Cette approche sans OCR permet d’exploiter directement la structure visuelle, y compris les tableaux, formulaires et graphiques. Son entraînement sur mMARCO et son ajustement pour la recherche l’orientent vers le retrieval. La longueur maximale annoncée de 262 144 tokens convient au traitement de documents longs. Les embeddings de dimension 128 favorisent des représentations compactes, tandis que la licence Apache 2.0 facilite le déploiement et l’adaptation.
Limites et points d’attention. Sur ViDoRe V1&V2, consacré à la recherche visuelle dans des documents de types et de domaines variés, le modèle se situe dans la moitié basse du classement, au 31e rang sur 48. Cette position indique une efficacité mesurable, sans le placer parmi les systèmes les mieux classés sur ce benchmark. La représentation multi-vecteur peut aussi multiplier le nombre de vecteurs conservés par document, ce qui atténue en partie l’avantage d’une dimension unitaire compacte pour le stockage et le calcul de similarité. Usages pertinents : recherche sémantique et RAG sur des collections de pages complexes, multilingues, comportant une forte composante visuelle.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).