DataScience-UIBK/Argus-Colqwen3.5-9b-v0

DataScience-UIBK/Argus-Colqwen3.5-9b-v0 est un modèle d’embedding de 9 milliards de paramètres, tous actifs, publié par DataScience-UIBK le 5 mai 2026 sous licence ouverte Apache 2.0. Construit sur Qwen3.5-VL-9B-Instruct, il produit des représentations multi-vecteurs de dimension 1024.

DataScience-UIBK/Argus-Colqwen3.5-9b-v0 est un modèle d’embedding de 9 milliards de paramètres, tous actifs, publié par DataScience-UIBK le 5 mai 2026 sous licence ouverte Apache 2.0. Construit sur Qwen3.5-VL-9B-Instruct, il produit des représentations multi-vecteurs de dimension 1024.

Ce retriever encode des requêtes textuelles et des images de documents afin d’effectuer une recherche sémantique visuelle. Sa tête de type ColPali applique une interaction tardive MaxSim et un mélange d’experts latent conditionné par la requête. Le modèle sert notamment à la recherche documentaire, au RAG, à la mesure de similarité et au clustering. Son usage cible principalement l’anglais.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurDataScience-UIBK
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie5 mai 2026
Dimension du vecteur1 024
Représentationmulti-vecteur (ColBERT / ColPali-style late interaction, MaxSim)
Paramètres9 milliards
Paramètres actifs9 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)86,0 %1ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ DataScience-UIBK/Argus-…86 %

Notre analyse

Forces. Argus-Colqwen3.5-9b-v0 se distingue dans ViDoRe V1 et V2, consacré à la recherche de documents visuels couvrant différents formats et domaines. Son classement en tête de ce benchmark indique une forte aptitude à retrouver une page ou un document imagé à partir d’une requête textuelle. L’approche multi-vecteur conserve des représentations locales des régions visuelles, puis MaxSim rapproche les éléments les plus pertinents de la requête et du document. Le mélange d’experts latent remplace la projection dense et adapte le traitement des régions de tokens visuels à la requête. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG.

Limites et points d'attention. Le modèle compte 9 milliards de paramètres actifs, ce qui implique un déploiement plus exigeant que celui d’un petit encodeur. La représentation multi-vecteur peut également alourdir les index et rendre la recherche plus coûteuse qu’avec un unique vecteur par document. L’usage est principalement anglophone, tandis que la part multilingue de l’entraînement reste limitée, ce qui appelle à la prudence pour des corpus dans d’autres langues. Usages pertinents : recherche sémantique dans des documents visuels anglophones, RAG documentaire, similarité et regroupement de pages ou d’images de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).