vidore/colqwen2-v1.0

Publié par vidore le 3 novembre 2025, vidore/colqwen2-v1.0 est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des représentations de dimension 128 selon une architecture late-interaction.

Publié par vidore le 3 novembre 2025, vidore/colqwen2-v1.0 est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des représentations de dimension 128 selon une architecture late-interaction.

Le modèle sert à indexer et rapprocher des contenus pour la recherche sémantique, la récupération de documents dans un système RAG, la mesure de similarité et le clustering. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvidore
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 novembre 2025
Dimension du vecteur128
Représentationlate-interaction
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)79,7 %30ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V344,7 %24ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB montrent une meilleure efficacité sur ViDoRe V1&V2, consacré à la recherche visuelle dans des documents de types et de domaines variés, que sur ViDoRe V3. Cette orientation convient à la récupération sémantique d’informations au sein de corpus documentaires hétérogènes. La dimension de sortie de 128 limite la taille de chaque représentation numérique, ce qui favorise des index plus légers. La licence Apache 2.0 facilite le déploiement sur une infrastructure maîtrisée et la réutilisation du modèle.

Limites et points d’attention. Sur ViDoRe V3, qui évalue la recherche dans des documents d’entreprise multimodaux, le modèle se situe dans la seconde moitié du classement et affiche un résultat nettement inférieur à celui obtenu sur ViDoRe V1&V2. Les corpus d’entreprise complexes constituent donc un cas plus exigeant. Malgré des vecteurs de dimension compacte, l’inférence mobilise 2 milliards de paramètres actifs, un facteur à prendre en compte pour les ressources de déploiement. Usages pertinents : recherche visuelle et sémantique, RAG documentaire, similarité et clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).