vultr/VultronRetrieverCore-Qwen3.5-4.5B
Publié par Vultr le 22 juin 2026, vultr/VultronRetrieverCore-Qwen3.5-4.5B est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Il produit une représentation dense multi-vecteurs de 320 dimensions par token, sans vecteur unique poolé.
Publié par Vultr le 22 juin 2026, vultr/VultronRetrieverCore-Qwen3.5-4.5B est un modèle d’embedding de 5 milliards de paramètres, tous actifs. Il produit une représentation dense multi-vecteurs de 320 dimensions par token, sans vecteur unique poolé.
Fondé sur Qwen3.5-4B et un backbone hybride GatedDeltaNet avec full-attention, ce retriever visuel couvre l’anglais, le français, l’allemand, l’espagnol, l’italien et le portugais. Sa licence ouverte Apache 2.0 facilite l’auto-hébergement. Il cible la recherche sémantique et le RAG multimodal dans des PDF, scans, diapositives et rapports.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | vultr |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 22 juin 2026 |
| Dimension du vecteur | 320 |
| Représentation | multi-vecteur dense par token 320 dimensions (late-interaction ColBERT/ColQwen3_5), avec scoring MaxSim ; pas de vecteur unique poolé |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 84,8 % | 6ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 63,6 % | 2ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les meilleurs sur ViDoRe V1&V2 et ViDoRe V3, deux évaluations consacrées à la recherche visuelle dans des documents variés, dont des documents multimodaux d’entreprise. Son architecture à interaction tardive de style ColBERT/ColQwen3_5 compare les représentations par token avec un scoring MaxSim. Cette approche convient aux pages mêlant texte, mise en page, tableaux, graphiques et figures. La couverture de six langues favorise aussi les corpus européens multilingues. La licence Apache 2.0 autorise des déploiements auto-hébergés et l’intégration dans des systèmes commerciaux.
Limites et points d’attention. Le résultat absolu sur ViDoRe V3 est inférieur à celui obtenu sur ViDoRe V1&V2, même si le classement reste parmi les meilleurs. Les représentations multi-vecteurs par token sont plus volumineuses qu’un embedding unique de 320 dimensions par document et rendent l’indexation ainsi que le scoring MaxSim plus coûteux. Avec 5 milliards de paramètres actifs, l’encodage exige également davantage de ressources qu’un petit modèle d’embedding. L’absence de vecteur unique poolé le rend moins directement adapté aux pipelines conçus pour la similarité globale ou le clustering classique. Usages pertinents : recherche visuelle multilingue et RAG multimodal sur PDF, scans, présentations et rapports complexes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).