microsoft/xclip-base-patch16
Publié par Microsoft le 4 août 2022 sous licence ouverte MIT, microsoft/xclip-base-patch16 est un modèle d’embedding de 195 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions associant vidéos et textes dans un même espace contrastif.
Publié par Microsoft le 4 août 2022 sous licence ouverte MIT, microsoft/xclip-base-patch16 est un modèle d’embedding de 195 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions associant vidéos et textes dans un même espace contrastif.
Cette extension de CLIP a été entraînée de manière supervisée sur Kinetics-400, à partir de huit images par vidéo en 224 × 224. Elle vise la recherche sémantique vidéo-texte, la sélection de contenus pour un RAG multimodal, la mesure de similarité, le clustering et la classification vidéo. Elle ne génère pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 4 août 2022 |
| Dimension du vecteur | 512 |
| Représentation | représentations vidéo et texte contrastives |
| Paramètres | 195 millions |
| Paramètres actifs | 195 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | video,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 55,6 % | 15ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 38,4 % | 19ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB Video-Text
Notre analyse
Forces. Les résultats MTEB placent le modèle plus favorablement sur MVEB Video-Only que sur MVEB Video-Text, avec un positionnement en milieu de tableau pour les tâches de classification et de pair classification vidéo. Son espace contrastif commun prend en charge la recherche vidéo-texte, l’évaluation de correspondance entre une requête et une vidéo, ainsi que la classification zero-shot, few-shot ou entièrement supervisée. Les vecteurs de 512 dimensions permettent des index relativement compacts, tandis que la licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des applications commerciales.
Limites et points d'attention. Le classement MVEB Video-Text se situe dans la partie basse du tableau, ce qui invite à évaluer soigneusement la qualité de la recherche, du clustering et de la classification croisant texte et vidéo. Sorti en 2022, le modèle est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings vidéo-langage plus récents. Son entraînement supervisé sur Kinetics-400, avec huit images par vidéo, l’ancre dans un cadre précis de compréhension vidéo. Usages pertinents : recherche vidéo-texte, indexation de catalogues audiovisuels, similarité entre clips et classification vidéo lorsque la licence ouverte et la compacité des vecteurs priment.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).