facebook/vjepa2-vitg-fpc64-384

Publié par Meta le 11 juin 2025, facebook/vjepa2-vitg-fpc64-384 est un modèle d’embedding vidéo à poids ouverts sous licence Apache 2.0. Son milliard de paramètres, tous actifs, produit des vecteurs denses de 1 408 dimensions. Il traite une vidéo à partir de 64 images échantillonnées.

Publié par Meta le 11 juin 2025, facebook/vjepa2-vitg-fpc64-384 est un modèle d’embedding vidéo à poids ouverts sous licence Apache 2.0. Son milliard de paramètres, tous actifs, produit des vecteurs denses de 1 408 dimensions. Il traite une vidéo à partir de 64 images échantillonnées.

Développé par FAIR dans la famille V-JEPA 2, il représente les vidéos et les images pour la recherche sémantique, la classification et le clustering. Il peut aussi servir de composant de recherche dans un RAG multimodal ou d’encodeur vidéo pour un modèle vision-langage. Une image fixe peut être répétée sur les images d’entrée.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie11 juin 2025
Dimension du vecteur1 408
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Modalités (entrée → sortie)video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only45,6 %26ᵉ / 32mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

VLM2Vec/VLM2Vec-V2.053 %
▶ facebook/vjepa2-vitg-fp…46 %

Notre analyse

Forces. Le modèle cible directement la compréhension visuelle par embeddings. Ses représentations conviennent à la recherche de vidéos similaires, à la classification vidéo et au regroupement de contenus visuels. L’échantillonnage de 64 images permet d’intégrer plusieurs moments d’une séquence dans un même traitement. La prise en charge des images fixes élargit son usage aux collections mêlant photographies et vidéos. La licence Apache 2.0 et les poids ouverts autorisent l’auto-hébergement, l’adaptation et l’intégration dans une infrastructure privée.

Limites et points d’attention. Le modèle se situe en retrait sur le track MVEB Video-Only de MTEB, où il partage la 26e place sur 32. Ce benchmark est plafonné et son score discrimine peu les modèles, mais il ne signale pas une performance de premier plan. Le milliard de paramètres impose des ressources d’inférence conséquentes. Les vecteurs de 1 408 dimensions alourdissent aussi le stockage des index et le calcul de similarité. Sorti depuis environ un an, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : auto-hébergement d’un encodeur Meta pour la recherche, la classification ou le clustering de vidéos et d’images.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).