vidore/colqwen2-v1.0
Publié par vidore le 3 novembre 2025, vidore/colqwen2-v1.0 est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des représentations de dimension 128 selon une architecture late-interaction.
Publié par vidore le 3 novembre 2025, vidore/colqwen2-v1.0 est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des représentations de dimension 128 selon une architecture late-interaction.
Le modèle sert à indexer et rapprocher des contenus pour la recherche sémantique, la récupération de documents dans un système RAG, la mesure de similarité et le clustering. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | vidore |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 3 novembre 2025 |
| Dimension du vecteur | 128 |
| Représentation | late-interaction |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 79,7 % | 30ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 44,7 % | 24ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Les résultats MTEB montrent une meilleure efficacité sur ViDoRe V1&V2, consacré à la recherche visuelle dans des documents de types et de domaines variés, que sur ViDoRe V3. Cette orientation convient à la récupération sémantique d’informations au sein de corpus documentaires hétérogènes. La dimension de sortie de 128 limite la taille de chaque représentation numérique, ce qui favorise des index plus légers. La licence Apache 2.0 facilite le déploiement sur une infrastructure maîtrisée et la réutilisation du modèle.
Limites et points d’attention. Sur ViDoRe V3, qui évalue la recherche dans des documents d’entreprise multimodaux, le modèle se situe dans la seconde moitié du classement et affiche un résultat nettement inférieur à celui obtenu sur ViDoRe V1&V2. Les corpus d’entreprise complexes constituent donc un cas plus exigeant. Malgré des vecteurs de dimension compacte, l’inférence mobilise 2 milliards de paramètres actifs, un facteur à prendre en compte pour les ressources de déploiement. Usages pertinents : recherche visuelle et sémantique, RAG documentaire, similarité et clustering de documents.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).