facebook/vjepa2-vitl-fpc16-256-ssv2
facebook/vjepa2-vitl-fpc16-256-ssv2 est un modèle dense de compréhension vidéo publié par Meta le 13 juin 2025 sous licence ouverte MIT. Son architecture ViT-L 256 compte 375 millions de paramètres, tous actifs, et produit des représentations vectorielles de 1 024 dimensions.
facebook/vjepa2-vitl-fpc16-256-ssv2 est un modèle dense de compréhension vidéo publié par Meta le 13 juin 2025 sous licence ouverte MIT. Son architecture ViT-L 256 compte 375 millions de paramètres, tous actifs, et produit des représentations vectorielles de 1 024 dimensions.
Cette variante de V-JEPA 2 intègre une tête de classification vidéo préentraînée sur Something-Something-V2. Elle traite des trames vidéo avec AutoVideoProcessor et AutoModelForVideoClassification afin de produire des logits de classes. Ses représentations peuvent servir à la recherche par similarité et au clustering de vidéos, notamment dans une chaîne de recherche sémantique ou de RAG multimodal.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 13 juin 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 375 millions |
| Paramètres actifs | 375 millions |
| Modalités (entrée → sortie) | video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 44,6 % | 30ᵉ / 32 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
Notre analyse
Forces. La principale force de facebook/vjepa2-vitl-fpc16-256-ssv2 réside dans sa spécialisation vidéo. Son préentraînement V-JEPA 2 et sa tête adaptée à Something-Something-V2 ciblent la compréhension et la classification d’actions à partir de trames. La représentation dense de 1 024 dimensions fournit un format directement exploitable pour comparer, regrouper ou indexer des contenus vidéo. La licence MIT facilite par ailleurs l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires ou ouverts.
Limites et points d'attention. Sur MVEB Video-Only, le modèle se situe près du bas du classement, ce qui indique une qualité d’embedding vidéo inférieure à celle de la plupart des modèles évalués sur les tâches de classification et de pair classification. Ses 375 millions de paramètres imposent aussi davantage de ressources qu’un petit encodeur, tandis que les vecteurs de 1 024 dimensions rendent l’index plus volumineux et la recherche plus coûteuse que des représentations plus compactes. Sorti il y a environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et peut être dépassé par des modèles vidéo plus récents. Usages pertinents : classification, similarité, indexation et clustering de vidéos dans un environnement auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).