vultr/VultronRetrieverFlash-Qwen3.5-0.8B
Publié par vultr le 21 juin 2026 sous licence ouverte Apache 2.0, vultr/VultronRetrieverFlash-Qwen3.5-0.8B est un modèle d’embedding de 853 millions de paramètres actifs. Fondé sur Qwen3.5-0.8B, il associe GatedDeltaNet et attention complète, sans tête générative.
Publié par vultr le 21 juin 2026 sous licence ouverte Apache 2.0, vultr/VultronRetrieverFlash-Qwen3.5-0.8B est un modèle d’embedding de 853 millions de paramètres actifs. Fondé sur Qwen3.5-0.8B, il associe GatedDeltaNet et attention complète, sans tête générative.
Le modèle encode les requêtes textuelles et les images de pages en représentations ColBERT de 320 dimensions par token, comparées par interaction tardive MaxSim. Il cible la recherche sémantique, le RAG multimodal, la similarité et le clustering de PDF, scans, diapositives ou rapports. Il prend en charge l’anglais, le français, l’allemand, l’espagnol, l’italien et le portugais.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | vultr |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 21 juin 2026 |
| Dimension du vecteur | 320 |
| Représentation | multi-vecteur (ColBERT), un vecteur de 320 dimensions par token, avec interaction tardive MaxSim |
| Paramètres | 853 millions |
| Paramètres actifs | 853 millions |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 80,2 % | 28ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 56,2 % | 16ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Les évaluations ViDoRe situent le modèle sur la recherche documentaire visuelle couvrant des formats et domaines variés, ainsi que sur des documents multimodaux d’entreprise, notamment financiers. Son positionnement relatif est meilleur sur ViDoRe V3 que sur l’ensemble ViDoRe V1&V2. L’encodage conjoint des pages et des requêtes convient aux contenus mêlant texte, tableaux, graphiques et figures. Les vecteurs de 320 dimensions par token limitent la taille de chaque représentation élémentaire, tandis que l’interaction MaxSim conserve une comparaison fine au niveau des tokens. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes de recherche.
Limites et points d'attention. Les rangs obtenus sur ViDoRe restent intermédiaires face aux autres modèles évalués, particulièrement sur l’ensemble V1&V2. L’approche multi-vecteur produit un vecteur pour chaque token : malgré leur dimension contenue, l’index total peut devenir plus volumineux et la recherche plus coûteuse qu’avec une représentation unique par document. Le modèle est spécialisé dans l’encodage et le classement, sans génération de texte. Usages pertinents : recherche sémantique et RAG multimodaux sur des PDF, scans, présentations et rapports multilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).