Qwen/Qwen3-VL-Embedding-2B

Publié par Qwen le 8 janvier 2026 sous licence ouverte Apache 2.0, Qwen/Qwen3-VL-Embedding-2B est un modèle d’embedding multimodal de 2 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL, il projette textes, images, captures d’écran et vidéos dans un espace vectoriel partagé.

Publié par Qwen le 8 janvier 2026 sous licence ouverte Apache 2.0, Qwen/Qwen3-VL-Embedding-2B est un modèle d’embedding multimodal de 2 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL, il projette textes, images, captures d’écran et vidéos dans un espace vectoriel partagé.

Le modèle produit une représentation dense à vecteur unique, configurable de 64 à 2048 dimensions, avec une dimension maximale de 2048. Son contexte atteint 32k et sa couverture dépasse 30 langues. Il sert notamment à la recherche sémantique, au RAG multimodal, au calcul de similarité et au clustering, avec prise en charge d’instructions personnalisées et de la quantification des embeddings.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 janvier 2026
Dimension du vecteur2 048
Représentationdense à vecteur unique, avec dimension configurable de 64 à 2048
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only62,3 %2ᵉ / 32mteb✅ Mesuré
MTEB: MVEB Video-Text58,1 %2ᵉ / 23mteb✅ Mesuré
MTEB: ViDoRe V352,6 %20ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

▶ Qwen/Qwen3-VL-Embedding…62 %

MTEB: MVEB Video-Text

▶ Qwen/Qwen3-VL-Embedding…58 %

Notre analyse

Forces. Qwen/Qwen3-VL-Embedding-2B se place parmi les meilleurs modèles évalués sur MVEB Video-Only et MVEB Video-Text. Ces résultats soulignent son aptitude à rapprocher des vidéos entre elles, mais aussi à aligner des contenus vidéo et textuels pour la recherche, la classification, la classification par paires et le clustering. L’espace partagé entre texte et contenus visuels facilite la constitution d’index multimodaux. Le contexte de 32k convient au traitement de documents longs, tandis que la couverture de plus de 30 langues élargit les corpus exploitables. La licence Apache 2.0 autorise l’auto-hébergement et l’adaptation. Le réglage de la dimension entre 64 et 2048 permet aussi d’arbitrer entre finesse des représentations et taille de l’index.

Limites et points d'attention. Le positionnement est moins favorable sur ViDoRe V3, où le modèle se situe dans la seconde moitié du classement pour la recherche dans des documents visuels multimodaux d’entreprise. La dimension maximale de 2048 alourdit le stockage des index et augmente le coût des recherches de similarité, même si une dimension réduite ou la quantification peuvent limiter cette charge. Les usages pertinents sont la recherche vidéo, la recherche texte-vidéo, le RAG multimodal, la détection de similarité et le clustering de corpus multilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).