facebook/vjepa2-vitg-fpc64-256
facebook/vjepa2-vitg-fpc64-256 est un modèle d’embedding dense de Meta, publié le 11 juin 2025 sous licence ouverte Apache 2.0. Ses 1 milliard de paramètres, tous actifs, transforment des vidéos et des images en vecteurs de 1 408 dimensions. Le traitement vidéo présenté repose sur une…
facebook/vjepa2-vitg-fpc64-256 est un modèle d’embedding dense de Meta, publié le 11 juin 2025 sous licence ouverte Apache 2.0. Ses 1 milliard de paramètres, tous actifs, transforment des vidéos et des images en vecteurs de 1 408 dimensions. Le traitement vidéo présenté repose sur une séquence de 64 images.
Développé par FAIR dans la famille V-JEPA 2, il sert à la recherche par similarité visuelle, au classement et au clustering de contenus vidéo, ainsi qu’à la classification. Il peut aussi fournir l’encodeur vidéo d’un système vision-langage. Pour une image fixe, celle-ci est répétée sur plusieurs images avant l’extraction des caractéristiques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 11 juin 2025 |
| Dimension du vecteur | 1 408 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Modalités (entrée → sortie) | video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 45,9 % | 25ᵉ / 32 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
Notre analyse
Forces. Le modèle est spécialisé dans la représentation vectorielle des vidéos et des images, plutôt que dans la génération de texte. Cette spécialisation permet de comparer, rechercher, regrouper ou classer des contenus à partir de leurs caractéristiques visuelles. Son traitement de séquences de 64 images apporte une représentation temporelle adaptée aux vidéos. La licence Apache 2.0 facilite l’auto-hébergement, l’intégration et l’adaptation du modèle. Il peut également servir de composant visuel dans une architecture vision-langage.
Limites et points d’attention. Sur MVEB Video-Only, qui mesure la qualité des embeddings vidéo en classification et en pair classification, son classement dans la partie basse du tableau indique une compétitivité limitée face aux autres modèles évalués. Les vecteurs denses de 1 408 dimensions rendent par ailleurs les index plus volumineux et les recherches plus coûteuses que des représentations plus compactes. Avec environ un an d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle est probablement dépassé par des références plus récentes et peut avoir été retiré du catalogue de l’éditeur. Usages pertinents : recherche vidéo, similarité visuelle, clustering, classification et encodage vidéo pour systèmes vision-langage.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).