DataScience-UIBK/Argus-Colqwen3.5-2b-v0

Publié le 3 mai 2026 par DataScience-UIBK, Argus-Colqwen3.5-2b-v0 est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des représentations multi-vecteurs de dimension 1024 et applique une interaction tardive MaxSim inspirée de ColPali et ColBERT.

Publié le 3 mai 2026 par DataScience-UIBK, Argus-Colqwen3.5-2b-v0 est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des représentations multi-vecteurs de dimension 1024 et applique une interaction tardive MaxSim inspirée de ColPali et ColBERT.

Ses poids sont ouverts sous licence Apache 2.0. L’entraînement est majoritairement anglophone, avec un petit sous-ensemble multilingue. Le modèle encode des requêtes textuelles et des pages sous forme d’images pour la recherche sémantique texte-image, la sélection de documents dans un RAG et la mesure de similarité. Le clustering nécessite une chaîne adaptée aux représentations multi-vecteurs.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurDataScience-UIBK
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 mai 2026
Dimension du vecteur1 024
Représentationmulti-vecteur (ColBERT/ColPali, interaction tardive MaxSim)
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)83,0 %17ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

ApsaraStackMaaS/EvoQwen…83 %
▶ DataScience-UIBK/Argus-…83 %

Notre analyse

Forces. Le modèle cible la recherche dans des documents visuels de types et de domaines variés. Sur ViDoRe V1 et V2, il partage la 17e place sur 48 modèles, ce qui le situe dans la première moitié du classement. Son mélange d’experts latent regroupe les jetons visuels en régions, puis les dirige vers deux des quatre spécialistes, avec un expert dense partagé. Ce mécanisme conditionné par la requête affine la comparaison entre texte et zones de page. La licence Apache 2.0 et les poids ouverts facilitent l’auto-hébergement et l’adaptation.

Limites et points d’attention. ViDoRe est plafonné, ce qui rend le résultat peu discriminant entre plusieurs modèles. L’entraînement surtout anglophone limite la portée du petit volet multilingue. Une représentation multi-vecteur occupe davantage d’espace qu’un vecteur unique par document, tandis que le calcul MaxSim rend la recherche plus coûteuse. Les 2 milliards de paramètres sont tous mobilisés à l’inférence. Le clustering standard demande aussi une agrégation ou un moteur compatible avec plusieurs vecteurs par page. Usages pertinents : recherche texte-image dans des pages numérisées, retrieval de documents visuels et sélection de contexte pour un RAG documentaire.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).