webAI-Official/webAI-ColVec1.1-8b

webAI-Official/webAI-ColVec1.1-8b est un modèle d’embedding multimodal de 8 milliards de paramètres actifs. Fondé sur Qwen3.5-9B, il utilise une attention bidirectionnelle et produit des vecteurs de 640 dimensions au niveau des tokens. Il traite des contenus multilingues. Ses poids sont…

webAI-Official/webAI-ColVec1.1-8b est un modèle d’embedding multimodal de 8 milliards de paramètres actifs. Fondé sur Qwen3.5-9B, il utilise une attention bidirectionnelle et produit des vecteurs de 640 dimensions au niveau des tokens. Il traite des contenus multilingues. Ses poids sont ouverts sous la licence publiée par webAI-Official.

Le modèle encode les requêtes textuelles et les documents visuels, notamment les images et les pages PDF rendues. Ses représentations multi-vecteurs normalisées servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Il recherche directement dans les documents sans OCR et ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurwebAI-Official
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/webAI-Official/webAI-ColVec1.1-8b/blob/main/LICENSE.md
Date de sortie22 juillet 2026
Dimension du vecteur640
Représentationmulti-vecteur (style ColBERT, embeddings au niveau des tokens avec interaction tardive MaxSim)
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe V364,9 %1ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe V3

▶ webAI-Official/webAI-Co…65 %

Notre analyse

Forces. webAI-ColVec1.1-8b se classe en tête de ViDoRe V3, un benchmark consacré à la recherche dans des documents visuels multimodaux d’entreprise. Son architecture de style ColBERT conserve des embeddings au niveau des tokens, puis applique une interaction tardive MaxSim. Cette approche favorise les correspondances fines entre une requête et les éléments d’une page. Le modèle convient particulièrement aux PDF complexes, aux images documentaires et aux contenus propres à un domaine. Son entraînement multilingue étend ces usages à plusieurs langues. Les poids ouverts facilitent aussi l’auto-hébergement.

Limites et points d’attention. Les 8 milliards de paramètres sont tous actifs lors de l’encodage, ce qui exige davantage de ressources qu’un encodeur plus petit. La représentation multi-vecteur stocke plusieurs embeddings par document. Elle produit donc des index plus volumineux et une recherche MaxSim plus coûteuse qu’une architecture à vecteur unique. La dimension de 640 s’applique à chaque représentation de token, ce qui renforce cet arbitrage entre précision des interactions et empreinte de l’index. Usages pertinents : recherche sans OCR dans des PDF ou images, RAG documentaire multimodal, similarité et regroupement de documents multilingues à mise en page complexe.


Sources des données : MTEB — Massive Text Embedding Benchmark.