facebook/vjepa2-vith-fpc64-256
Publié par Meta le 11 juin 2025, facebook/vjepa2-vith-fpc64-256 est un modèle d’embedding dense de 654 millions de paramètres, tous actifs. Il encode les vidéos et les images en vecteurs de 1 280 dimensions. Sous licence MIT, il peut être auto-hébergé et intégré à des applications…
Publié par Meta le 11 juin 2025, facebook/vjepa2-vith-fpc64-256 est un modèle d’embedding dense de 654 millions de paramètres, tous actifs. Il encode les vidéos et les images en vecteurs de 1 280 dimensions. Sous licence MIT, il peut être auto-hébergé et intégré à des applications commerciales.
Issu de V-JEPA 2, ce modèle traite une vidéo à partir de 64 images échantillonnées. Il sert à la classification, à la recherche sémantique et au clustering de contenus visuels, ainsi qu’à l’encodage vidéo dans des systèmes vision-langage ou des architectures RAG multimodales. Une image fixe peut être répétée sur plusieurs entrées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 11 juin 2025 |
| Dimension du vecteur | 1 280 |
| Représentation | dense |
| Paramètres | 654 millions |
| Paramètres actifs | 654 millions |
| Modalités (entrée → sortie) | video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 42,5 % | 31ᵉ / 32 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
Notre analyse
Forces. facebook/vjepa2-vith-fpc64-256 produit une représentation dense commune aux images et aux vidéos, adaptée à l’indexation, à la comparaison de similarité, au regroupement et à la classification de contenus visuels. Son traitement de 64 images échantillonnées permet de résumer une séquence vidéo dans un embedding exploitable par un moteur de recherche ou un modèle vision-langage. La licence MIT constitue un atout pratique pour l’auto-hébergement, la modification et l’intégration commerciale.
Limites et points d’attention. Sur MVEB Video-Only, consacré à la qualité des embeddings vidéo en classification et en pair classification, le modèle se situe près du bas du classement. Ses vecteurs de 1 280 dimensions rendent également les index plus volumineux et la recherche plus coûteuse que des représentations plus compactes. Avec environ un an d’ancienneté, durée très longue à l’échelle de l’IA, il est susceptible d’être dépassé par des modèles vidéo plus récents de sa catégorie. Usages pertinents : recherche et clustering de vidéos, classification visuelle, indexation d’images et encodage vidéo pour des systèmes multimodaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).