zhibinlan/UME-R1-2B
Publié par zhibinlan le 10 novembre 2025, UME-R1-2B est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 1 536 dimensions et combine embeddings discriminatifs et génératifs. Distribué sous licence ouverte Apache 2.0, il peut être modifié et…
Publié par zhibinlan le 10 novembre 2025, UME-R1-2B est un modèle d’embedding de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 1 536 dimensions et combine embeddings discriminatifs et génératifs. Distribué sous licence ouverte Apache 2.0, il peut être modifié et intégré à des applications commerciales.
Le modèle représente du texte, des images, des ensembles d’images, des vidéos et des combinaisons de ces modalités. Ses vecteurs servent notamment à la recherche sémantique, au RAG, à la mesure de similarité, au clustering et à la recherche entre texte et contenus visuels.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | zhibinlan |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 10 novembre 2025 |
| Dimension du vecteur | 1 536 |
| Représentation | embeddings discriminatifs + embeddings génératifs |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | image,text,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 57,4 % | 9ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 51,5 % | 11ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB Video-Text
Notre analyse
Forces. UME-R1-2B se distingue surtout sur MVEB Video-Only, où il figure dans le top 10 pour la classification et la comparaison de paires fondées sur des vidéos. MVEB Video-Text confirme aussi son intérêt pour les tâches associant texte et vidéo, notamment la recherche, la classification et le clustering. Son architecture Qwen2VLForConditionalGeneration a été entraînée en deux étapes, avec un SFT de démarrage à froid puis un apprentissage par renforcement. Les embeddings génératifs autorisent plusieurs échantillonnages à l’inférence afin d’améliorer les représentations. La licence Apache 2.0 facilite par ailleurs la réutilisation, la modification et l’intégration commerciale.
Limites et points d’attention. Les résultats sont moins bien classés sur MVEB Video-Text que sur le volet Video-Only, ce qui indique un positionnement plus favorable pour la représentation vidéo seule que pour l’alignement entre vidéo et texte. Les vecteurs de 1 536 dimensions imposent aussi un volume de stockage et un coût de recherche à prendre en compte lors de la création d’index importants. Usages pertinents : recherche sémantique multimodale, indexation vidéo, rapprochement texte-vidéo, RAG multimodal, classification et clustering de contenus visuels.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).