facebook/pe-av-large

Publié par Meta le 22 décembre 2025, facebook/pe-av-large est un modèle d’embedding multimodal de 2 milliards de paramètres actifs. Il produit des vecteurs de 1 024 dimensions dans un espace commun associant audio, vidéo et texte. Distribué sous licence ouverte Apache 2.0, il est…

Publié par Meta le 22 décembre 2025, facebook/pe-av-large est un modèle d’embedding multimodal de 2 milliards de paramètres actifs. Il produit des vecteurs de 1 024 dimensions dans un espace commun associant audio, vidéo et texte. Distribué sous licence ouverte Apache 2.0, il est utilisable avec transformers et perception_models.

Le modèle encode séparément ou conjointement l’audio, la vidéo et le texte, avec plusieurs formes d’alignement intermodal. Il traite toutes les frames et accepte des vidéos de longueur variable. Ces représentations servent à la recherche sémantique multimodale, au retrieval pour le RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie22 décembre 2025
Dimension du vecteur1 024
Représentationembeddings multimodaux dans un espace commun : audio seul, vidéo seule, audio-vidéo conjoint, texte aligné à l'audio, texte aligné à la vidéo, texte aligné à l'audio-vidéo, audio+texte conjoint, vidéo+texte conjoint
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max512 tokens
Modalités (entrée → sortie)audio,video,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only55,2 %16ᵉ / 32mteb✅ Mesuré
MTEB: MVEB54,3 %6ᵉ / 15mteb✅ Mesuré
MTEB: MVEB Video-Text52,4 %10ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur positionnement relatif de facebook/pe-av-large apparaît sur MVEB, consacré à la qualité des embeddings audio-vidéo pour des tâches de retrieval, de classification et de clustering, où il figure dans le top 10. Il atteint également le top 10 sur MVEB Video-Text, ce qui souligne son intérêt pour rapprocher des requêtes textuelles et des contenus vidéo. Son espace partagé couvre plusieurs combinaisons, dont audio-vidéo, audio-texte et vidéo-texte, ce qui facilite la constitution d’index multimodaux cohérents. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications, tandis que la prise en charge des vidéos de longueur variable élargit les formats exploitables.

Limites et points d’attention. Le résultat MVEB Video-Only se situe au milieu du classement, derrière le positionnement obtenu sur les tracks audio-visuel et vidéo-texte. Le modèle paraît donc davantage différencié par l’alignement entre modalités que par la seule représentation vidéo. Ses 2 milliards de paramètres actifs impliquent aussi un déploiement plus exigeant qu’un encodeur plus petit. Les vecteurs de 1 024 dimensions augmentent le volume des index et le coût des recherches par rapport à des représentations moins dimensionnelles. Usages pertinents : recherche audio-vidéo, recherche texte-vidéo, RAG multimodal, détection de similarité et clustering de contenus multimédias.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).