facebook/vjepa2-vitl-fpc64-256
Publié par Meta le 11 juin 2025 sous licence ouverte MIT, facebook/vjepa2-vitl-fpc64-256 est un modèle dense de compréhension vidéo développé par FAIR. Ses 326 millions de paramètres produisent des vecteurs de 1 024 dimensions à partir de vidéos et d’images.
Publié par Meta le 11 juin 2025 sous licence ouverte MIT, facebook/vjepa2-vitl-fpc64-256 est un modèle dense de compréhension vidéo développé par FAIR. Ses 326 millions de paramètres produisent des vecteurs de 1 024 dimensions à partir de vidéos et d’images.
Le modèle sert à la recherche sémantique, à la classification et au clustering de contenus visuels. Il peut aussi fournir l’encodeur vidéo d’un système vision-langage ou alimenter un pipeline RAG portant sur des vidéos et des images. Le traitement vidéo repose sur des séquences de 64 images, tandis qu’une image fixe est répétée avant l’extraction de ses caractéristiques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 11 juin 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 326 millions |
| Paramètres actifs | 326 millions |
| Modalités (entrée → sortie) | video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 45,2 % | 28ᵉ / 32 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
Notre analyse
Forces. V-JEPA 2 étend les objectifs de préentraînement de V-JEPA afin de produire une représentation commune exploitable pour les vidéos et les images. Cette spécialisation répond aux besoins de recherche par similarité, de classification vidéo, de regroupement de contenus et d’indexation pour des systèmes vision-langage. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration commerciale. Les embeddings denses de 1 024 dimensions offrent une représentation directement compatible avec les bases vectorielles, avec un compromis entre richesse descriptive et volume d’index.
Limites et points d'attention. Sur MVEB Video-Only, le modèle se situe dans le bas du classement, ce qui indique une qualité d’embedding vidéo inférieure à celle de la majorité des modèles évalués sur les tâches de classification et de pair classification. La dimension de 1 024 alourdit aussi le stockage des index et le calcul de similarité par rapport à des vecteurs plus compacts. Avec 326 millions de paramètres actifs, le déploiement reste plus exigeant que celui de petits encodeurs. Son ancienneté, longue à l’échelle de l’IA, le rend probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : indexation, recherche, classification et clustering de vidéos ou d’images dans un environnement auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).