TomoroAI/tomoro-colqwen3-embed-8b
Publié par TomoroAI le 26 novembre 2025 sous licence ouverte Apache 2.0, TomoroAI/tomoro-colqwen3-embed-8b est un modèle d’embedding multimodal de 8 milliards de paramètres actifs. Il associe Qwen3-VL-8B-Instruct à Qwen3-Embedding-8B dans une architecture encoder-only et produit des…
Publié par TomoroAI le 26 novembre 2025 sous licence ouverte Apache 2.0, TomoroAI/tomoro-colqwen3-embed-8b est un modèle d’embedding multimodal de 8 milliards de paramètres actifs. Il associe Qwen3-VL-8B-Instruct à Qwen3-Embedding-8B dans une architecture encoder-only et produit des représentations multi-vecteurs de 320 dimensions.
Le modèle encode des requêtes textuelles, des images, des PDF et de courtes vidéos avec une interaction tardive MaxSim de type ColPali. Évalué en anglais et dans des contextes multilingues, il cible la recherche sémantique et visuelle, la récupération de contenus pour le RAG, la mesure de similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | TomoroAI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 26 novembre 2025 |
| Dimension du vecteur | 320 |
| Représentation | multi-vecteur (ColPali / Late Interaction MaxSim) |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 83,5 % | 13ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 61,6 % | 6ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Les résultats sur ViDoRe V3 placent le modèle dans le top 10 pour la recherche au sein de documents d’entreprise multimodaux, notamment dans des contenus financiers. ViDoRe V1&V2 confirme son aptitude à retrouver des informations dans des documents visuels issus de types et de domaines variés. Les évaluations couvrent des contextes anglais et multilingues ainsi que des domaines spécialisés, dont le biomédical, l’ESG, l’économie, la finance, les ressources humaines, l’industrie, la pharmacie, la physique et l’informatique. La projection en 320 dimensions limite la taille de chaque vecteur, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires ou ouverts.
Limites et points d'attention. Le classement sur ViDoRe V1&V2 est moins favorable que sur ViDoRe V3, ce qui traduit un avantage relatif plus marqué sur les documents d’entreprise multimodaux que sur l’ensemble plus diversifié des documents visuels. Les 8 milliards de paramètres actifs imposent davantage de ressources d’inférence que des encodeurs plus petits. La représentation multi-vecteurs et le calcul MaxSim peuvent aussi alourdir l’index et rendre la recherche plus coûteuse, malgré les 320 dimensions de chaque projection. Usages pertinents : recherche visuelle et sémantique dans des PDF, images et courtes vidéos, récupération documentaire pour le RAG, similarité et clustering de contenus multimodaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).