webAI-Official/webAI-ColVec1-4b

Publié le 5 avril 2026 par webAI-Official, webAI-ColVec1-4b est un modèle d’embedding multimodal de 5 milliards de paramètres, tous actifs. Fondé sur Qwen3.5-4B, il associe un encodeur unifié pour le texte et les images à une projection linéaire de dimension 640. Sa distribution relève…

Publié le 5 avril 2026 par webAI-Official, webAI-ColVec1-4b est un modèle d’embedding multimodal de 5 milliards de paramètres, tous actifs. Fondé sur Qwen3.5-4B, il associe un encodeur unifié pour le texte et les images à une projection linéaire de dimension 640. Sa distribution relève de plusieurs licences.

Le modèle produit des représentations multi-vecteurs normalisées L2 et applique une interaction tardive MaxSim au niveau des tokens. Multilingue, il encode les requêtes textuelles et les documents visuels, notamment les images et les PDF. Il cible la recherche sémantique et multimodale, la récupération de contexte pour le RAG, la similarité, le clustering et la recherche dans des documents sans OCR.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurwebAI-Official
Poids🟢 Poids ouverts
Licencemultiple
Date de sortie5 avril 2026
Dimension du vecteur640
Représentationmulti-vecteur (ColBERT, interaction tardive MaxSim)
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)82,8 %20ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V362,2 %5ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. webAI-ColVec1-4b se distingue surtout en recherche visuelle de documents. Son classement dans le top 10 de ViDoRe V3 indique une bonne aptitude à retrouver des informations dans des documents d’entreprise multimodaux. L’architecture ColBERT conserve plusieurs vecteurs par contenu, puis compare finement les tokens avec MaxSim, plutôt que de réduire chaque requête ou document à un seul vecteur. L’encodeur commun au texte et aux images facilite la mise en correspondance entre une requête textuelle et des pages visuelles. La prise en charge des images et PDF sans OCR constitue aussi un atout pour les documents dont la structure graphique porte une part importante de l’information.

Limites et points d'attention. Sur ViDoRe V1&V2, le modèle se situe davantage au milieu du classement, ce qui traduit des résultats moins distinctifs sur cet ensemble plus diversifié de tâches et de domaines. La représentation multi-vecteurs implique de stocker plusieurs vecteurs par document et d’exécuter une interaction MaxSim tardive. Par rapport à une approche à vecteur unique, ce choix peut alourdir les index et rendre la recherche plus exigeante en calcul. Le régime de licences multiples doit également être intégré au cadre de déploiement. Usages pertinents : recherche multilingue dans des PDF et images, retrieval multimodal pour le RAG, compréhension de documents-images et recherche sans OCR.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).