athrael-soju/colqwen3.5-4.5B-v3
Publié le 15 mars 2026 par athrael-soju, athrael-soju/colqwen3.5-4.5B-v3 est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Il produit des représentations multi-vecteurs de 128 dimensions selon une approche d’interaction tardive de style ColBERT. Distribué sous licence…
Publié le 15 mars 2026 par athrael-soju, athrael-soju/colqwen3.5-4.5B-v3 est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Il produit des représentations multi-vecteurs de 128 dimensions selon une approche d’interaction tardive de style ColBERT. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé.
Fondé sur Qwen3.5-4B, le modèle encode des images de documents et des requêtes textuelles, puis calcule leur proximité avec MaxSim. Son entraînement couvre notamment cinq langues, la finance et les tableaux. Il cible la recherche sémantique et visuelle, la récupération de contexte pour le RAG, la mesure de similarité et le clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | athrael-soju |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 mars 2026 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur (ColBERT-style late interaction) |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 83,7 % | 11ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 61,5 % | 8ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Les résultats MTEB placent athrael-soju/colqwen3.5-4.5B-v3 parmi les modèles les mieux classés sur ViDoRe V3 et à un niveau solide sur ViDoRe V1&V2. Ces tracks évaluent la recherche visuelle dans des documents variés, dont des contenus multimodaux d’entreprise. Le modèle est donc particulièrement adapté au rapprochement entre requêtes textuelles et pages contenant du texte, des tableaux ou des éléments visuels, notamment dans le domaine financier. Sa tête de projection est entraînée en 320 dimensions, tandis que les vecteurs de sortie comptent 128 dimensions. Cette sortie compacte peut alléger chaque vecteur stocké. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes de recherche.
Limites et points d'attention. Le résultat sur ViDoRe V3 reste sensiblement inférieur à celui obtenu sur ViDoRe V1&V2, ce qui signale une difficulté accrue face aux documents multimodaux d’entreprise de ce track. Malgré la dimension compacte de chaque vecteur, la représentation multi-vecteur conserve plusieurs embeddings par contenu et le calcul MaxSim compare leurs interactions. L’indexation et la recherche peuvent donc être plus lourdes qu’avec un embedding à vecteur unique. Les usages pertinents sont la recherche visuelle de documents, le RAG documentaire, la similarité et le regroupement de contenus multilingues, financiers ou tabulaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).