microsoft/xclip-large-patch14

Publié par Microsoft le 4 août 2022, microsoft/xclip-large-patch14 est un modèle d’embedding vidéo-texte de 576 millions de paramètres actifs. Il projette les vidéos et les textes associés dans des vecteurs de 768 dimensions afin de mesurer leur proximité sémantique.

Publié par Microsoft le 4 août 2022, microsoft/xclip-large-patch14 est un modèle d’embedding vidéo-texte de 576 millions de paramètres actifs. Il projette les vidéos et les textes associés dans des vecteurs de 768 dimensions afin de mesurer leur proximité sémantique.

Cette extension de CLIP est entraînée de manière contrastive sur des paires vidéo-texte et supervisée sur Kinetics-400, avec huit images par vidéo en 224 × 224. Sous licence ouverte MIT, elle se prête à l’auto-hébergement pour la recherche vidéo-texte, le RAG multimodal, le clustering, la classification vidéo et l’évaluation de l’adéquation entre une requête textuelle et une vidéo.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMicrosoft
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie4 août 2022
Dimension du vecteur768
Représentationvidéo + texte (paires vidéo-texte contrastives)
Paramètres576 millions
Paramètres actifs576 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)video,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only58,6 %5ᵉ / 32mteb✅ Mesuré
MTEB: MVEB Video-Text42,9 %18ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

▶ microsoft/xclip-large-p…59 %

MTEB: MVEB Video-Text

VLM2Vec/VLM2Vec-V2.045 %
▶ microsoft/xclip-large-p…43 %

Notre analyse

Forces. Les résultats de MVEB placent microsoft/xclip-large-patch14 dans le top 10 en Video-Only, ce qui souligne la qualité de ses représentations pour la classification et la comparaison de vidéos. Le modèle prend en charge la classification vidéo zero-shot, few-shot ou entièrement supervisée. Son espace commun vidéo-texte permet aussi la récupération de vidéos à partir d’un texte et le classement de contenus selon leur adéquation sémantique. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes commerciaux.

Limites et points d'attention. Le résultat MVEB Video-Text se situe dans la partie basse du classement, nettement moins favorable que celui obtenu en Video-Only. L’alignement entre requêtes textuelles et vidéos constitue donc un point de vigilance pour les moteurs de recherche multimodaux et les pipelines RAG. Avec 576 millions de paramètres actifs et des vecteurs de 768 dimensions, le déploiement implique un modèle substantiel ainsi qu’un index plus lourd et une recherche plus coûteuse que pour des embeddings de plus faible dimension. Sorti en 2022, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré des catalogues actuels. Usages pertinents : classification vidéo, similarité entre vidéos, clustering et recherche vidéo-texte après évaluation sur les données ciblées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).