facebook/vjepa2-vitg-fpc32-384-diving48
Publié par Meta le 13 juin 2025 sous licence ouverte MIT, facebook/vjepa2-vitg-fpc32-384-diving48 est un modèle dense de 1 milliard de paramètres, tous actifs. Il produit des représentations vectorielles de dimension 1 408 à partir de contenus vidéo.
Publié par Meta le 13 juin 2025 sous licence ouverte MIT, facebook/vjepa2-vitg-fpc32-384-diving48 est un modèle dense de 1 milliard de paramètres, tous actifs. Il produit des représentations vectorielles de dimension 1 408 à partir de contenus vidéo.
Cette variante de V-JEPA 2 repose sur une architecture ViT-g 384 et une tête de classification préentraînée sur Diving 48. Ses vecteurs peuvent servir à la recherche sémantique de vidéos, au RAG multimodal, à la mesure de similarité et au clustering de séquences vidéo. AutoVideoProcessor et AutoModelForVideoClassification permettent aussi de produire des logits de classes depuis des trames échantillonnées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 13 juin 2025 |
| Dimension du vecteur | 1 408 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Modalités (entrée → sortie) | video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 46,2 % | 24ᵉ / 32 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
Notre analyse
Forces. La spécialisation vidéo constitue son principal intérêt: le préentraînement V-JEPA 2 est associé à une tête adaptée à la classification d’actions de plongeon. Son évaluation sur MVEB Video-Only couvre la classification et la classification de paires, ce qui correspond à des usages de catégorisation, de rapprochement et d’organisation de vidéos. La licence MIT autorise l’auto-hébergement et une intégration souple dans des systèmes de recherche ou d’analyse. La couverture repose sur deux sources de données concordantes.
Limites et points d'attention. Son classement sur MVEB Video-Only le place dans la partie basse des modèles évalués, ce qui invite à comparer sa qualité d’embedding avec des solutions vidéo plus récentes. Les vecteurs denses de dimension 1 408 alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Le milliard de paramètres augmente également les besoins de calcul pour l’inférence. Son ancienneté, très importante à l’échelle de l’IA, le rattache à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents: classification, similarité, clustering et recherche sémantique de vidéos centrées sur des actions proches de Diving 48.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).