webAI-Official/webAI-ColVec1-9b
webAI-Official/webAI-ColVec1-9b est un modèle d'embedding multimodal de 9 milliards de paramètres, tous actifs, publié par webAI-Official sous plusieurs licences. Fondé sur Qwen3.5-9B Vision-Language Model, il produit des représentations multi-vecteurs ColBERT, L2-normalisées par token,…
webAI-Official/webAI-ColVec1-9b est un modèle d'embedding multimodal de 9 milliards de paramètres, tous actifs, publié par webAI-Official sous plusieurs licences. Fondé sur Qwen3.5-9B Vision-Language Model, il produit des représentations multi-vecteurs ColBERT, L2-normalisées par token, au moyen d'une projection de 2 560 dimensions.
Son encodeur unifié traite les requêtes textuelles et les documents visuels, notamment les images et PDF. Entraîné sur des données multilingues, il vise la recherche sémantique, le retrieval pour le RAG, la similarité et le clustering de documents, avec un calcul de pertinence par interaction tardive MaxSim.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | webAI-Official |
| Poids | 🟢 Poids ouverts |
| Licence | multiple |
| Date de sortie | 5 avril 2026 |
| Dimension du vecteur | 2 560 |
| Représentation | multi-vecteur ColBERT / late interaction, avec embeddings L2-normalisés par token |
| Paramètres | 9 milliards |
| Paramètres actifs | 9 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 84,0 % | 9ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 63,0 % | 4ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. webAI-ColVec1-9b se classe dans le top 10 de ViDoRe V1&V2 et ViDoRe V3, ce qui le positionne favorablement pour la recherche dans des documents visuels variés et des contenus d'entreprise multimodaux. La représentation par token préserve des correspondances fines entre une requête et les éléments d'une page, tandis que MaxSim agrège ces interactions au moment de la recherche. L'entraînement réunit des données multilingues et des documents comprenant tableaux, contenus financiers, médicaux, industriels et mises en page complexes. Les poids bfloat16 et la compatibilité avec FlashAttention 2 constituent aussi des caractéristiques utiles au déploiement.
Limites et points d'attention. L'architecture compte 9 milliards de paramètres actifs, ce qui impose des besoins de calcul et de mémoire supérieurs à ceux d'encodeurs plus petits. La projection de 2 560 dimensions appliquée à chaque token, combinée à une représentation multi-vecteurs, alourdit les index par rapport à un embedding unique par document. L'interaction tardive MaxSim accroît également le coût de comparaison lors du retrieval. La coexistence de plusieurs licences demande de distinguer les conditions applicables au déploiement envisagé. Usages pertinents : recherche sémantique multimodale, RAG sur images ou PDF, rapprochement et clustering de documents visuels complexes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).