OpenSearch-AI/Ops-Colqwen3-4B

OpenSearch-AI/Ops-Colqwen3-4B est un modèle d’embedding multimodal de 5 milliards de paramètres actifs, publié par OpenSearch-AI sous licence ouverte Apache 2.0. Fondé sur Qwen3-VL-4B-Instruct, il couvre plus de 30 langues et accepte un contexte allant jusqu’à 32 000 tokens.

OpenSearch-AI/Ops-Colqwen3-4B est un modèle d’embedding multimodal de 5 milliards de paramètres actifs, publié par OpenSearch-AI sous licence ouverte Apache 2.0. Fondé sur Qwen3-VL-4B-Instruct, il couvre plus de 30 langues et accepte un contexte allant jusqu’à 32 000 tokens.

Le modèle représente les requêtes textuelles, les images et les pages PDF dans un espace multi-vecteur unifié de style ColPali. Ses vecteurs, configurables jusqu’à 2 560 dimensions, sont comparés par similarité MaxSim. Cette architecture cible la recherche sémantique dans des documents visuels, le RAG multimodal, la mesure de similarité et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOpenSearch-AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie24 janvier 2026
Dimension du vecteur2 560
Représentationmulti-vecteur (style ColPali), multimodale texte-image/PDF, avec similarité MaxSim
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)84,9 %4ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V361,2 %9ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Ops-Colqwen3-4B se classe dans le top 10 des évaluations ViDoRe V1, V2 et V3. Ces résultats le positionnent favorablement pour la recherche visuelle dans des documents de types et de domaines variés, ainsi que dans des corpus d’entreprise multimodaux. L’alignement des requêtes textuelles avec les images et pages PDF permet de rechercher directement à partir de leur contenu visuel, sans réduire la représentation à un vecteur unique. Le contexte de 32 000 tokens convient aux documents longs, tandis que la prise en charge de plus de 30 langues facilite les corpus multilingues. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.

Limites et points d’attention. Le résultat sur ViDoRe V3 reste moins élevé que sur ViDoRe V1 et V2, même si le modèle demeure dans le top 10 de ce track. La représentation multi-vecteur, la dimension maximale de 2 560 et le calcul MaxSim peuvent alourdir les index et rendre la recherche plus coûteuse qu’avec des embeddings compacts à vecteur unique. Les 5 milliards de paramètres actifs impliquent aussi une exécution plus lourde que celle de petits encodeurs. Usages pertinents : recherche dans des PDF et images, RAG multimodal, similarité documentaire et clustering multilingue.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).