facebook/vjepa2-vitg-fpc64-384-ssv2

Publié par Meta le 13 juin 2025, facebook/vjepa2-vitg-fpc64-384-ssv2 est un modèle d’embedding vidéo à poids ouverts sous licence MIT. Son architecture ViT-g 384 compte 1 milliard de paramètres actifs. Elle traite 64 images par séquence et produit une représentation dense de 1 408…

Publié par Meta le 13 juin 2025, facebook/vjepa2-vitg-fpc64-384-ssv2 est un modèle d’embedding vidéo à poids ouverts sous licence MIT. Son architecture ViT-g 384 compte 1 milliard de paramètres actifs. Elle traite 64 images par séquence et produit une représentation dense de 1 408 dimensions.

Cette variante de V-JEPA 2 intègre une tête de classification vidéo préentraînée sur Something-Something-V2. Ses vecteurs servent à la recherche sémantique dans des vidéos, à la mesure de similarité, au clustering et à la récupération de contenus pour un RAG multimodal. Le modèle ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie13 juin 2025
Dimension du vecteur1 408
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Modalités (entrée → sortie)video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only45,6 %26ᵉ / 32mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

VLM2Vec/VLM2Vec-V2.053 %
▶ facebook/vjepa2-vitg-fp…46 %

Notre analyse

Forces. Sa spécialisation porte sur la compréhension vidéo, avec des représentations exploitables pour la classification et la comparaison de séquences. Le préentraînement de la tête vidéo sur Something-Something-V2 facilite son emploi sur des contenus centrés sur les actions. L’intégration avec AutoModelForVideoClassification et AutoVideoProcessor simplifie son déploiement dans l’écosystème Transformers. Les poids ouverts et la licence MIT autorisent l’auto-hébergement ainsi que l’intégration dans des applications commerciales.

Limites et points d'attention. Le modèle se situe en retrait sur MVEB Video-Only, à la 26e place sur 32, ex aequo avec un autre modèle. Ce benchmark est plafonné et son score discrimine peu les solutions évaluées. Le milliard de paramètres actifs demande des ressources substantielles. Les vecteurs de 1 408 dimensions alourdissent aussi les index et rendent la recherche plus coûteuse. Le traitement de 64 images par séquence nécessite un découpage ou un échantillonnage des vidéos longues. Âgé d’environ un an, il est déjà ancien à l’échelle de l’IA et probablement dépassé par des modèles vidéo plus récents. Usages pertinents : prototypage auto-hébergé, classification d’actions, recherche par similarité et clustering de séquences vidéo.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).