TomoroAI/tomoro-colqwen3-embed-4b
TomoroAI/tomoro-colqwen3-embed-4b est un modèle d’embedding multimodal de 4 milliards de paramètres, publié par TomoroAI le 26 novembre 2025 sous licence ouverte Apache 2.0. Il associe un encodeur dérivé de Qwen3-VL à une projection de 320 dimensions et produit des représentations…
TomoroAI/tomoro-colqwen3-embed-4b est un modèle d’embedding multimodal de 4 milliards de paramètres, publié par TomoroAI le 26 novembre 2025 sous licence ouverte Apache 2.0. Il associe un encodeur dérivé de Qwen3-VL à une projection de 320 dimensions et produit des représentations multi-vecteurs normalisées L2.
Son architecture à interaction tardive de type ColPali utilise MaxSim pour rapprocher requêtes textuelles et contenus visuels. Elle cible la recherche sémantique dans des images, des documents et de courtes vidéos, ainsi que la récupération de contexte pour le RAG, la similarité et le clustering. Le modèle a été évalué en anglais et dans des contextes multilingues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | TomoroAI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 26 novembre 2025 |
| Dimension du vecteur | 320 |
| Représentation | multi-vecteur (interaction tardive de type ColPali/MaxSim) |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 83,2 % | 15ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 60,2 % | 10ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les dix premiers sur ViDoRe V3 et dans la première moitié sur ViDoRe V1&V2. Son point fort est donc la recherche visuelle dans des documents variés, notamment des documents multimodaux d’entreprise couvrant plusieurs domaines. Les embeddings multi-vecteurs conservent des représentations fines, puis MaxSim établit la correspondance entre les éléments d’une requête et ceux d’un document. La projection de 320 dimensions limite l’empreinte de chaque vecteur. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG.
Limites et points d’attention. Le rang obtenu sur ViDoRe V1&V2 reste en retrait par rapport aux modèles en tête de ce track. L’approche multi-vecteur peut aussi multiplier le nombre de représentations à indexer, ce qui atténue le bénéfice d’une dimension unitaire compacte et peut alourdir le stockage ainsi que le calcul MaxSim. Les vidéos courtes sont traitées image par image, et cette capacité résulte d’une généralisation, l’entraînement ayant porté uniquement sur des paires image-texte. Usages pertinents : recherche dans des documents visuels, récupération multimodale pour le RAG et rapprochement de contenus par similarité.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).