webAI-Official/webAI-ColVec1-9b

webAI-Official/webAI-ColVec1-9b est un modèle d'embedding multimodal de 9 milliards de paramètres, tous actifs, publié par webAI-Official sous plusieurs licences. Fondé sur Qwen3.5-9B Vision-Language Model, il produit des représentations multi-vecteurs ColBERT, L2-normalisées par token,…

webAI-Official/webAI-ColVec1-9b est un modèle d'embedding multimodal de 9 milliards de paramètres, tous actifs, publié par webAI-Official sous plusieurs licences. Fondé sur Qwen3.5-9B Vision-Language Model, il produit des représentations multi-vecteurs ColBERT, L2-normalisées par token, au moyen d'une projection de 2 560 dimensions.

Son encodeur unifié traite les requêtes textuelles et les documents visuels, notamment les images et PDF. Entraîné sur des données multilingues, il vise la recherche sémantique, le retrieval pour le RAG, la similarité et le clustering de documents, avec un calcul de pertinence par interaction tardive MaxSim.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurwebAI-Official
Poids🟢 Poids ouverts
Licencemultiple
Date de sortie5 avril 2026
Dimension du vecteur2 560
Représentationmulti-vecteur ColBERT / late interaction, avec embeddings L2-normalisés par token
Paramètres9 milliards
Paramètres actifs9 milliards
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)84,0 %9ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V363,0 %4ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. webAI-ColVec1-9b se classe dans le top 10 de ViDoRe V1&V2 et ViDoRe V3, ce qui le positionne favorablement pour la recherche dans des documents visuels variés et des contenus d'entreprise multimodaux. La représentation par token préserve des correspondances fines entre une requête et les éléments d'une page, tandis que MaxSim agrège ces interactions au moment de la recherche. L'entraînement réunit des données multilingues et des documents comprenant tableaux, contenus financiers, médicaux, industriels et mises en page complexes. Les poids bfloat16 et la compatibilité avec FlashAttention 2 constituent aussi des caractéristiques utiles au déploiement.

Limites et points d'attention. L'architecture compte 9 milliards de paramètres actifs, ce qui impose des besoins de calcul et de mémoire supérieurs à ceux d'encodeurs plus petits. La projection de 2 560 dimensions appliquée à chaque token, combinée à une représentation multi-vecteurs, alourdit les index par rapport à un embedding unique par document. L'interaction tardive MaxSim accroît également le coût de comparaison lors du retrieval. La coexistence de plusieurs licences demande de distinguer les conditions applicables au déploiement envisagé. Usages pertinents : recherche sémantique multimodale, RAG sur images ou PDF, rapprochement et clustering de documents visuels complexes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).