Qwen/Qwen3-VL-Embedding-8B

Qwen/Qwen3-VL-Embedding-8B est un modèle d’embedding multimodal de Qwen, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres transforment textes, images, captures d’écran, vidéos et combinaisons multimodales en un vecteur dense unique. Sa dimension de sortie est…

Qwen/Qwen3-VL-Embedding-8B est un modèle d’embedding multimodal de Qwen, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres transforment textes, images, captures d’écran, vidéos et combinaisons multimodales en un vecteur dense unique. Sa dimension de sortie est personnalisable de 64 à 4096, avec 4096 comme dimension maximale.

Fondé sur l’architecture Qwen3-VL, il partage un même espace de représentation entre contenus visuels et textuels. Il traite un contexte de 32K, couvre plus de 30 langues et sert à la recherche sémantique, à la récupération de contenus pour le RAG, au calcul de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 janvier 2026
Dimension du vecteur4 096
Représentationvecteur dense multimodal unique, à dimension personnalisable de 64 à 4096
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only63,5 %1ᵉ / 32mteb✅ Mesuré
MTEB: MVEB Video-Text60,9 %1ᵉ / 23mteb✅ Mesuré
MTEB: ViDoRe V357,8 %12ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

▶ Qwen/Qwen3-VL-Embedding…64 %

MTEB: MVEB Video-Text

▶ Qwen/Qwen3-VL-Embedding…61 %

Notre analyse

Forces. Qwen/Qwen3-VL-Embedding-8B se classe en tête des évaluations MVEB Video-Only et MVEB Video-Text, ce qui souligne son aptitude à rapprocher des vidéos, à relier texte et vidéo, ainsi qu’à traiter des tâches de recherche, de classification et de clustering multimodales. Son contexte de 32K convient à l’indexation de contenus longs. Les dimensions réglables de 64 à 4096 permettent d’arbitrer entre finesse des représentations et taille des index. La quantification des embeddings peut également alléger leur stockage. Sa licence Apache 2.0 autorise l’auto-hébergement et l’adaptation, tandis que les instructions peuvent être personnalisées selon la tâche.

Limites et points d’attention. Le classement sur ViDoRe V3 est moins dominant que sur les évaluations vidéo, ce qui invite à valider les performances sur la recherche dans des documents visuels d’entreprise, notamment financiers. À 4096 dimensions, les vecteurs produisent des index plus lourds et rendent les recherches plus coûteuses qu’avec une sortie compacte. Réduire la dimension ou quantifier les embeddings diminue cette charge, avec un compromis potentiel sur la précision des rapprochements. Usages pertinents : recherche multimodale, RAG sur corpus textuels et visuels, recherche vidéo, détection de similarité et clustering multilingue.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).