webAI-Official/webAI-ColVec1.1-4b

Publié par webAI-Official le 22 juillet 2026, webAI-ColVec1.1-4b est un modèle d’embedding multimodal de 5 milliards de paramètres actifs, fondé sur Qwen3.5-4B. Ses poids sont ouverts et encadrés par une licence dédiée. Il produit des vecteurs de 640 dimensions pour chaque token, avec…

Publié par webAI-Official le 22 juillet 2026, webAI-ColVec1.1-4b est un modèle d’embedding multimodal de 5 milliards de paramètres actifs, fondé sur Qwen3.5-4B. Ses poids sont ouverts et encadrés par une licence dédiée. Il produit des vecteurs de 640 dimensions pour chaque token, avec une normalisation L2.

Son encodeur unifié associe des requêtes textuelles à des images ou à des pages PDF rendues. Cette représentation multilingue de style ColBERT vise la recherche sémantique, la sélection de contenus pour le RAG, la mesure de similarité et le clustering. Le modèle ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurwebAI-Official
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/webAI-Official/webAI-ColVec1.1-4b/blob/main/LICENSE.md
Date de sortie22 juillet 2026
Dimension du vecteur640
Représentationmulti-vecteur au niveau des tokens (style ColBERT), normalisée L2
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe V363,9 %3ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe V3

webAI-Official/webAI-Co…65 %
▶ webAI-Official/webAI-Co…64 %

Notre analyse

Forces. webAI-ColVec1.1-4b se classe parmi les meilleurs de ViDoRe V3 pour la recherche dans des documents visuels et multimodaux d’entreprise. L’attention bidirectionnelle et les représentations multi-vecteurs préservent les informations au niveau des tokens. Le score MaxSim compare finement les éléments d’une requête avec ceux d’une page lors de l’interaction tardive. L’entraînement combine des sous-ensembles filtrés, équilibrés et multilingues avec des données synthétiques. Les poids ouverts facilitent l’auto-hébergement et l’adaptation de la chaîne d’indexation.

Limites et points d’attention. Les 5 milliards de paramètres sont tous actifs pendant l’encodage. Cette taille impose des ressources de calcul et de mémoire adaptées au déploiement. La représentation multi-vecteurs stocke plusieurs vecteurs de 640 dimensions par contenu, ce qui alourdit l’index par rapport à une représentation à vecteur unique. La recherche MaxSim demande aussi davantage de calcul qu’une simple comparaison entre deux vecteurs globaux. Le traitement des PDF passe par le rendu visuel de leurs pages. Les usages pertinents couvrent la recherche multimodale, le retrieval pour le RAG, la similarité et le regroupement de documents visuels multilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark.