vultr/VultronRetrieverFlash-Qwen3.5-0.8B

Publié par vultr le 21 juin 2026 sous licence ouverte Apache 2.0, vultr/VultronRetrieverFlash-Qwen3.5-0.8B est un modèle d’embedding de 853 millions de paramètres actifs. Fondé sur Qwen3.5-0.8B, il associe GatedDeltaNet et attention complète, sans tête générative.

Publié par vultr le 21 juin 2026 sous licence ouverte Apache 2.0, vultr/VultronRetrieverFlash-Qwen3.5-0.8B est un modèle d’embedding de 853 millions de paramètres actifs. Fondé sur Qwen3.5-0.8B, il associe GatedDeltaNet et attention complète, sans tête générative.

Le modèle encode les requêtes textuelles et les images de pages en représentations ColBERT de 320 dimensions par token, comparées par interaction tardive MaxSim. Il cible la recherche sémantique, le RAG multimodal, la similarité et le clustering de PDF, scans, diapositives ou rapports. Il prend en charge l’anglais, le français, l’allemand, l’espagnol, l’italien et le portugais.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvultr
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie21 juin 2026
Dimension du vecteur320
Représentationmulti-vecteur (ColBERT), un vecteur de 320 dimensions par token, avec interaction tardive MaxSim
Paramètres853 millions
Paramètres actifs853 millions
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)80,2 %28ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V356,2 %16ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ vultr/VultronRetrieverF…80 %

MTEB: ViDoRe V3

▶ vultr/VultronRetrieverF…56 %
Verm1ion/ColTurk-VDR-Qw…56 %

Notre analyse

Forces. Les évaluations ViDoRe situent le modèle sur la recherche documentaire visuelle couvrant des formats et domaines variés, ainsi que sur des documents multimodaux d’entreprise, notamment financiers. Son positionnement relatif est meilleur sur ViDoRe V3 que sur l’ensemble ViDoRe V1&V2. L’encodage conjoint des pages et des requêtes convient aux contenus mêlant texte, tableaux, graphiques et figures. Les vecteurs de 320 dimensions par token limitent la taille de chaque représentation élémentaire, tandis que l’interaction MaxSim conserve une comparaison fine au niveau des tokens. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes de recherche.

Limites et points d'attention. Les rangs obtenus sur ViDoRe restent intermédiaires face aux autres modèles évalués, particulièrement sur l’ensemble V1&V2. L’approche multi-vecteur produit un vecteur pour chaque token : malgré leur dimension contenue, l’index total peut devenir plus volumineux et la recherche plus coûteuse qu’avec une représentation unique par document. Le modèle est spécialisé dans l’encodage et le classement, sans génération de texte. Usages pertinents : recherche sémantique et RAG multimodaux sur des PDF, scans, présentations et rapports multilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).