facebook/pe-av-small

facebook/pe-av-small est un modèle d’embedding multimodal de Meta, publié le 22 décembre 2025 sous licence ouverte Apache 2.0. Ses 847 millions de paramètres, tous actifs, produisent des vecteurs denses de 1 024 dimensions.

facebook/pe-av-small est un modèle d’embedding multimodal de Meta, publié le 22 décembre 2025 sous licence ouverte Apache 2.0. Ses 847 millions de paramètres, tous actifs, produisent des vecteurs denses de 1 024 dimensions.

Le modèle aligne dans un espace partagé l’audio, la vidéo et le texte associé. Il encode séparément ou conjointement plusieurs combinaisons de modalités, y compris audio-vidéo, audio-texte et vidéo-texte. Il sert à la recherche sémantique multimodale, à la récupération de contenus pour le RAG, à la mesure de similarité et au clustering. Il accepte des vidéos de longueur variable et peut fonctionner avec certaines modalités omises.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie22 décembre 2025
Dimension du vecteur1 024
Représentationembeddings denses multimodaux dans un espace partagé : audio, vidéo, audio-vidéo, texte aligné à l’audio, texte aligné à la vidéo, texte aligné à l’audio-vidéo, audio + texte et vidéo + texte
Paramètres847 millions
Paramètres actifs847 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)audio,video,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only53,3 %20ᵉ / 32mteb✅ Mesuré
MTEB: MVEB52,2 %9ᵉ / 15mteb✅ Mesuré
MTEB: MVEB Video-Text50,2 %13ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur positionnement relatif de facebook/pe-av-small apparaît sur MVEB, où il figure dans le top 10 pour la qualité des embeddings audio-vidéo évaluée sur des tâches de retrieval, de classification et de clustering. L’apprentissage contrastif rapproche audio, vidéo et texte dans un même espace vectoriel, tandis que les embeddings textuels sont optimisés selon la paire de modalités. Cette architecture facilite la recherche croisée entre médias et descriptions, ainsi que le regroupement de contenus multimodaux. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires ou ouverts.

Limites et points d'attention. Les résultats sont plus modestes sur MVEB Video-Only et MVEB Video-Text, où le modèle se situe dans la seconde moitié des classements. Les performances apparaissent donc moins compétitives lorsque l’évaluation porte uniquement sur la vidéo ou sur l’alignement entre texte et vidéo. Les vecteurs de 1 024 dimensions impliquent aussi un volume d’indexation et un coût de recherche à prendre en compte à grande échelle. Usages pertinents : recherche audio-vidéo, retrieval multimodal pour le RAG, classification, similarité et clustering de médias accompagnés de texte.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).