facebook/vjepa2-vith-fpc64-256

Publié par Meta le 11 juin 2025, facebook/vjepa2-vith-fpc64-256 est un modèle d’embedding dense de 654 millions de paramètres, tous actifs. Il encode les vidéos et les images en vecteurs de 1 280 dimensions. Sous licence MIT, il peut être auto-hébergé et intégré à des applications…

Publié par Meta le 11 juin 2025, facebook/vjepa2-vith-fpc64-256 est un modèle d’embedding dense de 654 millions de paramètres, tous actifs. Il encode les vidéos et les images en vecteurs de 1 280 dimensions. Sous licence MIT, il peut être auto-hébergé et intégré à des applications commerciales.

Issu de V-JEPA 2, ce modèle traite une vidéo à partir de 64 images échantillonnées. Il sert à la classification, à la recherche sémantique et au clustering de contenus visuels, ainsi qu’à l’encodage vidéo dans des systèmes vision-langage ou des architectures RAG multimodales. Une image fixe peut être répétée sur plusieurs entrées.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie11 juin 2025
Dimension du vecteur1 280
Représentationdense
Paramètres654 millions
Paramètres actifs654 millions
Modalités (entrée → sortie)video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only42,5 %31ᵉ / 32mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

VLM2Vec/VLM2Vec-V2.053 %
▶ facebook/vjepa2-vith-fp…43 %

Notre analyse

Forces. facebook/vjepa2-vith-fpc64-256 produit une représentation dense commune aux images et aux vidéos, adaptée à l’indexation, à la comparaison de similarité, au regroupement et à la classification de contenus visuels. Son traitement de 64 images échantillonnées permet de résumer une séquence vidéo dans un embedding exploitable par un moteur de recherche ou un modèle vision-langage. La licence MIT constitue un atout pratique pour l’auto-hébergement, la modification et l’intégration commerciale.

Limites et points d’attention. Sur MVEB Video-Only, consacré à la qualité des embeddings vidéo en classification et en pair classification, le modèle se situe près du bas du classement. Ses vecteurs de 1 280 dimensions rendent également les index plus volumineux et la recherche plus coûteuse que des représentations plus compactes. Avec environ un an d’ancienneté, durée très longue à l’échelle de l’IA, il est susceptible d’être dépassé par des modèles vidéo plus récents de sa catégorie. Usages pertinents : recherche et clustering de vidéos, classification visuelle, indexation d’images et encodage vidéo pour des systèmes multimodaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).