OpenSearch-AI/Ops-Colqwen3-4B
OpenSearch-AI/Ops-Colqwen3-4B est un modèle d’embedding multimodal de 5 milliards de paramètres actifs, publié par OpenSearch-AI sous licence ouverte Apache 2.0. Fondé sur Qwen3-VL-4B-Instruct, il couvre plus de 30 langues et accepte un contexte allant jusqu’à 32 000 tokens.
OpenSearch-AI/Ops-Colqwen3-4B est un modèle d’embedding multimodal de 5 milliards de paramètres actifs, publié par OpenSearch-AI sous licence ouverte Apache 2.0. Fondé sur Qwen3-VL-4B-Instruct, il couvre plus de 30 langues et accepte un contexte allant jusqu’à 32 000 tokens.
Le modèle représente les requêtes textuelles, les images et les pages PDF dans un espace multi-vecteur unifié de style ColPali. Ses vecteurs, configurables jusqu’à 2 560 dimensions, sont comparés par similarité MaxSim. Cette architecture cible la recherche sémantique dans des documents visuels, le RAG multimodal, la mesure de similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OpenSearch-AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 24 janvier 2026 |
| Dimension du vecteur | 2 560 |
| Représentation | multi-vecteur (style ColPali), multimodale texte-image/PDF, avec similarité MaxSim |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 84,9 % | 4ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 61,2 % | 9ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Ops-Colqwen3-4B se classe dans le top 10 des évaluations ViDoRe V1, V2 et V3. Ces résultats le positionnent favorablement pour la recherche visuelle dans des documents de types et de domaines variés, ainsi que dans des corpus d’entreprise multimodaux. L’alignement des requêtes textuelles avec les images et pages PDF permet de rechercher directement à partir de leur contenu visuel, sans réduire la représentation à un vecteur unique. Le contexte de 32 000 tokens convient aux documents longs, tandis que la prise en charge de plus de 30 langues facilite les corpus multilingues. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.
Limites et points d’attention. Le résultat sur ViDoRe V3 reste moins élevé que sur ViDoRe V1 et V2, même si le modèle demeure dans le top 10 de ce track. La représentation multi-vecteur, la dimension maximale de 2 560 et le calcul MaxSim peuvent alourdir les index et rendre la recherche plus coûteuse qu’avec des embeddings compacts à vecteur unique. Les 5 milliards de paramètres actifs impliquent aussi une exécution plus lourde que celle de petits encodeurs. Usages pertinents : recherche dans des PDF et images, RAG multimodal, similarité documentaire et clustering multilingue.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).