microsoft/xclip-base-patch32
Publié par Microsoft le 4 août 2022 sous licence ouverte MIT, microsoft/xclip-base-patch32 est un modèle d’embedding vidéo-texte de 197 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions afin de rapprocher des vidéos et des descriptions textuelles dans un même…
Publié par Microsoft le 4 août 2022 sous licence ouverte MIT, microsoft/xclip-base-patch32 est un modèle d’embedding vidéo-texte de 197 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions afin de rapprocher des vidéos et des descriptions textuelles dans un même espace sémantique.
Cette extension de CLIP a été entraînée par apprentissage contrastif supervisé sur Kinetics-400, à partir de huit images de 224 × 224 par vidéo. Elle cible la recherche vidéo-texte, l’évaluation de correspondances, la classification vidéo et le clustering. Ses vecteurs peuvent aussi alimenter un système RAG fondé sur la récupération de contenus vidéo.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 4 août 2022 |
| Dimension du vecteur | 512 |
| Représentation | La card ne précise pas si les représentations sont denses, creuses ou multi-vecteurs. |
| Paramètres | 197 millions |
| Paramètres actifs | 197 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | video,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 53,0 % | 21ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 35,9 % | 21ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB Video-Text
Notre analyse
Forces. Le principal intérêt de microsoft/xclip-base-patch32 réside dans l’association entre vidéo et langage. Il prend en charge la recherche vidéo-texte ainsi que la classification vidéo zero-shot, few-shot ou entièrement supervisée. Sur MTEB, son meilleur résultat absolu concerne MVEB Video-Only, qui évalue notamment la classification et la classification par paires, même si son classement reste dans la seconde moitié du panel. La sortie de 512 dimensions permet de constituer des index vectoriels relativement compacts. La licence MIT autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. MVEB Video-Text constitue son volet le moins convaincant, avec un positionnement proche du bas du classement sur les tâches mêlant texte et vidéo, notamment la recherche, la classification et le clustering. Sorti en 2022, le modèle est très ancien à l’échelle de l’IA et peut être dépassé par des approches plus récentes de compréhension vidéo-langage. Son entraînement supervisé sur Kinetics-400 et son traitement de huit images par vidéo cadrent étroitement son approche temporelle. Usages pertinents : prototypage auto-hébergé de recherche vidéo-texte, classification vidéo et indexation sémantique de collections audiovisuelles.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).