DataScience-UIBK/Argus-Colqwen3.5-4b-v0

Publié le 29 avril 2026 par DataScience-UIBK, Argus-Colqwen3.5-4b-v0 est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Fondé sur Qwen3.5-VL-4B-Instruct, il produit des représentations par jeton de dimension 1024 selon une architecture multi-vecteur de type ColPali.

Publié le 29 avril 2026 par DataScience-UIBK, Argus-Colqwen3.5-4b-v0 est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Fondé sur Qwen3.5-VL-4B-Instruct, il produit des représentations par jeton de dimension 1024 selon une architecture multi-vecteur de type ColPali.

Principalement anglophone, il associe des requêtes textuelles à des pages représentées sous forme d’images. Cette spécialisation vise la recherche sémantique dans des documents visuels, la sélection de contenus pour le RAG, la mesure de similarité et le clustering. Sa licence Apache 2.0 autorise des déploiements et adaptations dans un cadre ouvert.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurDataScience-UIBK
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie29 avril 2026
Dimension du vecteur1 024
Représentationmulti-vecteur par jeton (ColBERT/ColPali) avec interaction tardive MaxSim
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)84,3 %7ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Argus-Colqwen3.5-4b-v0 se distingue sur ViDoRe V1 et V2, où il figure dans le top 10 pour la recherche de documents visuels couvrant différents types de pages et domaines. Son interaction tardive MaxSim compare finement les représentations de chaque jeton plutôt que de réduire une page à un vecteur unique. La projection emploie un mélange d’experts latent conditionné par la requête : les jetons visuels sont regroupés en régions, puis chaque région est orientée vers deux spécialistes parmi quatre, avec un expert dense partagé. Cette conception favorise l’appariement détaillé entre une question textuelle et le contenu visuel d’une page. La licence Apache 2.0 facilite l’auto-hébergement, l’intégration et la modification.

Limites et points d’attention. Le modèle est principalement anglophone, même si son entraînement inclut des sous-ensembles publics de VDR-Multilingual. La représentation multi-vecteur par jeton implique des index plus volumineux et une recherche MaxSim plus coûteuse qu’une représentation à vecteur unique. Avec 5 milliards de paramètres actifs, son exécution demande également davantage de ressources qu’un petit encodeur. Usages pertinents : recherche de pages visuelles, RAG documentaire fondé sur des images, similarité et clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).