zhibinlan/UME-R1-7B
Publié le 10 novembre 2025 par zhibinlan, zhibinlan/UME-R1-7B est un modèle d’embedding de 8 milliards de paramètres, tous actifs. Il produit des vecteurs de 3 584 dimensions et associe représentations discriminatives et génératives. Sa licence ouverte Apache 2.0 autorise notamment son…
Publié le 10 novembre 2025 par zhibinlan, zhibinlan/UME-R1-7B est un modèle d’embedding de 8 milliards de paramètres, tous actifs. Il produit des vecteurs de 3 584 dimensions et associe représentations discriminatives et génératives. Sa licence ouverte Apache 2.0 autorise notamment son auto-hébergement.
Le modèle encode du texte, des images, des ensembles d’images, des vidéos et des combinaisons de ces modalités. Ces représentations servent à la recherche sémantique, à la récupération de contenus pour le RAG, à la mesure de similarité et au clustering. Son entraînement combine une phase initiale de SFT et une phase de RL.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | zhibinlan |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 10 novembre 2025 |
| Dimension du vecteur | 3 584 |
| Représentation | discriminative + générative |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | image,text,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 57,5 % | 8ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 53,3 % | 9ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB Video-Text
Notre analyse
Forces. zhibinlan/UME-R1-7B se classe dans le top 10 des évaluations MTEB MVEB Video-Only et Video-Text. Ces résultats signalent une aptitude notable pour la classification de vidéos, la classification par paires et, dans un cadre associant texte et vidéo, la recherche, la classification et le clustering. La prise en charge de plusieurs images, de vidéos et de combinaisons multimodales élargit son emploi au-delà des corpus uniquement textuels. Les embeddings peuvent être discriminatifs ou génératifs selon la tâche, les seconds pouvant bénéficier d’un scaling au moment du test. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des services internes. L’utilisation repose sur Transformers, avec Qwen2VLForConditionalGeneration et AutoProcessor.
Limites et points d’attention. Malgré leur présence dans le top 10, les résultats MVEB Video-Only et Video-Text ne placent pas le modèle aux toutes premières positions de leurs classements respectifs. Les vecteurs de 3 584 dimensions impliquent des index plus volumineux et une recherche plus coûteuse que des représentations plus compactes. Les 8 milliards de paramètres actifs alourdissent aussi le déploiement et le calcul d’inférence. Usages pertinents : recherche sémantique multimodale, RAG associant texte, images ou vidéos, détection de similarité, classification et clustering de contenus audiovisuels.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).