facebook/vjepa2-vitl-fpc32-256-diving48
Publié par Meta le 13 juin 2025 sous licence ouverte MIT, facebook/vjepa2-vitl-fpc32-256-diving48 est un modèle d’embedding dense de 375 millions de paramètres actifs. Son architecture ViT-L 256 produit des représentations de 1 024 dimensions et se concentre sur la compréhension de…
Publié par Meta le 13 juin 2025 sous licence ouverte MIT, facebook/vjepa2-vitl-fpc32-256-diving48 est un modèle d’embedding dense de 375 millions de paramètres actifs. Son architecture ViT-L 256 produit des représentations de 1 024 dimensions et se concentre sur la compréhension de contenus vidéo.
Développé par FAIR, il étend les objectifs de préentraînement de V-JEPA 2 avec une tête de classification vidéo préentraînée sur Diving 48. Associé à un préprocesseur vidéo, il peut servir à la classification, à la recherche par similarité, au clustering et à l’indexation de vidéos pour des systèmes de recherche sémantique ou de RAG multimodal.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 13 juin 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 375 millions |
| Paramètres actifs | 375 millions |
| Modalités (entrée → sortie) | video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 44,8 % | 29ᵉ / 32 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
Notre analyse
Forces. La spécialisation vidéo constitue son principal intérêt. L’architecture ViT-L 256 traite des images échantillonnées dans une vidéo, tandis que la tête préentraînée sur Diving 48 produit des logits de classes avec AutoModelForVideoClassification. Les représentations denses de 1 024 dimensions peuvent alimenter des tâches de similarité, de regroupement et de recherche dans des collections vidéo. La licence MIT autorise l’auto-hébergement, l’adaptation et l’intégration dans des applications commerciales.
Limites et points d'attention. Sur MVEB Video-Only, qui évalue notamment la classification et la classification par paires, le modèle se situe dans le bas du classement. Il ne fait donc pas partie des références les plus performantes de ce benchmark. Ses 375 millions de paramètres et ses vecteurs de 1 024 dimensions impliquent aussi davantage de mémoire pour le modèle et les index, ainsi qu’une recherche vectorielle plus coûteuse que pour des embeddings plus compacts. Sorti en juin 2025, il est déjà ancien à l’échelle rapide de l’IA et peut être dépassé par des modèles vidéo plus récents. Usages pertinents : classification spécialisée, indexation, similarité et clustering de vidéos, notamment autour de scènes comparables à Diving 48.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).