TomoroAI/tomoro-colqwen3-embed-4b

TomoroAI/tomoro-colqwen3-embed-4b est un modèle d’embedding multimodal de 4 milliards de paramètres, publié par TomoroAI le 26 novembre 2025 sous licence ouverte Apache 2.0. Il associe un encodeur dérivé de Qwen3-VL à une projection de 320 dimensions et produit des représentations…

TomoroAI/tomoro-colqwen3-embed-4b est un modèle d’embedding multimodal de 4 milliards de paramètres, publié par TomoroAI le 26 novembre 2025 sous licence ouverte Apache 2.0. Il associe un encodeur dérivé de Qwen3-VL à une projection de 320 dimensions et produit des représentations multi-vecteurs normalisées L2.

Son architecture à interaction tardive de type ColPali utilise MaxSim pour rapprocher requêtes textuelles et contenus visuels. Elle cible la recherche sémantique dans des images, des documents et de courtes vidéos, ainsi que la récupération de contexte pour le RAG, la similarité et le clustering. Le modèle a été évalué en anglais et dans des contextes multilingues.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurTomoroAI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie26 novembre 2025
Dimension du vecteur320
Représentationmulti-vecteur (interaction tardive de type ColPali/MaxSim)
Paramètres4 milliards
Paramètres actifs4 milliards
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)83,2 %15ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V360,2 %10ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

ApsaraStackMaaS/EvoQwen…83 %
▶ TomoroAI/tomoro-colqwen…83 %

MTEB: ViDoRe V3

▶ TomoroAI/tomoro-colqwen…60 %

Notre analyse

Forces. Les résultats MTEB placent le modèle parmi les dix premiers sur ViDoRe V3 et dans la première moitié sur ViDoRe V1&V2. Son point fort est donc la recherche visuelle dans des documents variés, notamment des documents multimodaux d’entreprise couvrant plusieurs domaines. Les embeddings multi-vecteurs conservent des représentations fines, puis MaxSim établit la correspondance entre les éléments d’une requête et ceux d’un document. La projection de 320 dimensions limite l’empreinte de chaque vecteur. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG.

Limites et points d’attention. Le rang obtenu sur ViDoRe V1&V2 reste en retrait par rapport aux modèles en tête de ce track. L’approche multi-vecteur peut aussi multiplier le nombre de représentations à indexer, ce qui atténue le bénéfice d’une dimension unitaire compacte et peut alourdir le stockage ainsi que le calcul MaxSim. Les vidéos courtes sont traitées image par image, et cette capacité résulte d’une généralisation, l’entraînement ayant porté uniquement sur des paires image-texte. Usages pertinents : recherche dans des documents visuels, récupération multimodale pour le RAG et rapprochement de contenus par similarité.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).