zhibinlan/UME-R1-2B

Publié par zhibinlan le 10 novembre 2025, UME-R1-2B est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 1 536 dimensions et combine embeddings discriminatifs et génératifs. Distribué sous licence ouverte Apache 2.0, il peut être modifié et…

Publié par zhibinlan le 10 novembre 2025, UME-R1-2B est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 1 536 dimensions et combine embeddings discriminatifs et génératifs. Distribué sous licence ouverte Apache 2.0, il peut être modifié et intégré à des applications commerciales.

Le modèle représente du texte, des images, des ensembles d’images, des vidéos et des combinaisons de ces modalités. Ses vecteurs servent notamment à la recherche sémantique, au RAG, à la mesure de similarité, au clustering et à la recherche entre texte et contenus visuels.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurzhibinlan
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie10 novembre 2025
Dimension du vecteur1 536
Représentationembeddings discriminatifs + embeddings génératifs
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only57,4 %9ᵉ / 32mteb✅ Mesuré
MTEB: MVEB Video-Text51,5 %11ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. UME-R1-2B se distingue surtout sur MVEB Video-Only, où il figure dans le top 10 pour la classification et la comparaison de paires fondées sur des vidéos. MVEB Video-Text confirme aussi son intérêt pour les tâches associant texte et vidéo, notamment la recherche, la classification et le clustering. Son architecture Qwen2VLForConditionalGeneration a été entraînée en deux étapes, avec un SFT de démarrage à froid puis un apprentissage par renforcement. Les embeddings génératifs autorisent plusieurs échantillonnages à l’inférence afin d’améliorer les représentations. La licence Apache 2.0 facilite par ailleurs la réutilisation, la modification et l’intégration commerciale.

Limites et points d’attention. Les résultats sont moins bien classés sur MVEB Video-Text que sur le volet Video-Only, ce qui indique un positionnement plus favorable pour la représentation vidéo seule que pour l’alignement entre vidéo et texte. Les vecteurs de 1 536 dimensions imposent aussi un volume de stockage et un coût de recherche à prendre en compte lors de la création d’index importants. Usages pertinents : recherche sémantique multimodale, indexation vidéo, rapprochement texte-vidéo, RAG multimodal, classification et clustering de contenus visuels.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).