facebook/pe-av-base
facebook/pe-av-base est un modèle d’embedding multimodal de Meta, sorti le 22 décembre 2025 sous licence ouverte Apache 2.0. Son milliard de paramètres, tous actifs, produit des vecteurs de 1 024 dimensions dans un espace partagé entre l’audio, la vidéo, l’audio-vidéo et le texte.
facebook/pe-av-base est un modèle d’embedding multimodal de Meta, sorti le 22 décembre 2025 sous licence ouverte Apache 2.0. Son milliard de paramètres, tous actifs, produit des vecteurs de 1 024 dimensions dans un espace partagé entre l’audio, la vidéo, l’audio-vidéo et le texte.
Entraîné par apprentissage contrastif, il aligne les modalités pour comparer des contenus par produit scalaire. Il traite séparément chaque modalité et plusieurs combinaisons, avec des représentations textuelles adaptées aux paires considérées. Il sert à la recherche sémantique multimodale, à la récupération de contenus pour le RAG, au classement par similarité et au clustering. Il accepte des vidéos de longueur variable et exploite toutes leurs images.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 22 décembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | embeddings vectoriels dans un espace partagé pour l’audio, la vidéo, l’audio-vidéo et le texte, avec représentations conjointes audio-texte et vidéo-texte |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | audio,video,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 53,8 % | 19ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB | 53,1 % | 7ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 49,7 % | 14ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB
Notre analyse
Forces. Le meilleur positionnement relatif de facebook/pe-av-base apparaît sur MVEB, où il figure dans le top 10 pour la qualité des embeddings audio-visuels appliqués notamment à la recherche, à la classification et au clustering. Son espace partagé facilite la recherche intermodale, par exemple pour rapprocher une requête textuelle d’une vidéo ou associer des contenus audio-visuels similaires. L’encodage des combinaisons audio-vidéo, audio-texte et vidéo-texte apporte une représentation adaptée aux relations entre modalités. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG.
Limites et points d'attention. Les résultats sont plus en retrait sur MVEB Video-Only et MVEB Video-Text, où le modèle se situe dans la seconde moitié des classements indiqués. La dimension de 1 024 augmente la taille des index vectoriels et le coût des calculs de similarité par rapport à des représentations plus compactes. L’utilisation de toutes les images d’une vidéo implique aussi un volume de traitement lié à sa longueur. Les embeddings textuels étant adaptés à différentes paires de modalités, la représentation appropriée doit correspondre au type de comparaison visé. Usages pertinents : recherche audio-visuelle, rapprochement texte-vidéo, déduplication multimodale, clustering de médias et récupération de contenus pour un pipeline RAG.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).