facebook/pe-av-large
Publié par Meta le 22 décembre 2025, facebook/pe-av-large est un modèle d’embedding multimodal de 2 milliards de paramètres actifs. Il produit des vecteurs de 1 024 dimensions dans un espace commun associant audio, vidéo et texte. Distribué sous licence ouverte Apache 2.0, il est…
Publié par Meta le 22 décembre 2025, facebook/pe-av-large est un modèle d’embedding multimodal de 2 milliards de paramètres actifs. Il produit des vecteurs de 1 024 dimensions dans un espace commun associant audio, vidéo et texte. Distribué sous licence ouverte Apache 2.0, il est utilisable avec transformers et perception_models.
Le modèle encode séparément ou conjointement l’audio, la vidéo et le texte, avec plusieurs formes d’alignement intermodal. Il traite toutes les frames et accepte des vidéos de longueur variable. Ces représentations servent à la recherche sémantique multimodale, au retrieval pour le RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 22 décembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | embeddings multimodaux dans un espace commun : audio seul, vidéo seule, audio-vidéo conjoint, texte aligné à l'audio, texte aligné à la vidéo, texte aligné à l'audio-vidéo, audio+texte conjoint, vidéo+texte conjoint |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | audio,video,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 55,2 % | 16ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB | 54,3 % | 6ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 52,4 % | 10ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB
Notre analyse
Forces. Le meilleur positionnement relatif de facebook/pe-av-large apparaît sur MVEB, consacré à la qualité des embeddings audio-vidéo pour des tâches de retrieval, de classification et de clustering, où il figure dans le top 10. Il atteint également le top 10 sur MVEB Video-Text, ce qui souligne son intérêt pour rapprocher des requêtes textuelles et des contenus vidéo. Son espace partagé couvre plusieurs combinaisons, dont audio-vidéo, audio-texte et vidéo-texte, ce qui facilite la constitution d’index multimodaux cohérents. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications, tandis que la prise en charge des vidéos de longueur variable élargit les formats exploitables.
Limites et points d’attention. Le résultat MVEB Video-Only se situe au milieu du classement, derrière le positionnement obtenu sur les tracks audio-visuel et vidéo-texte. Le modèle paraît donc davantage différencié par l’alignement entre modalités que par la seule représentation vidéo. Ses 2 milliards de paramètres actifs impliquent aussi un déploiement plus exigeant qu’un encodeur plus petit. Les vecteurs de 1 024 dimensions augmentent le volume des index et le coût des recherches par rapport à des représentations moins dimensionnelles. Usages pertinents : recherche audio-vidéo, recherche texte-vidéo, RAG multimodal, détection de similarité et clustering de contenus multimédias.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).