encord-team/ebind-audio-vision
Publié par encord-team le 19 novembre 2025, encord-team/ebind-audio-vision est un modèle d’embedding multimodal de 764 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC-SA 4.0. Il produit un vecteur dense unique de 1 024 dimensions, normalisé à la norme unité.
Publié par encord-team le 19 novembre 2025, encord-team/ebind-audio-vision est un modèle d’embedding multimodal de 764 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC-SA 4.0. Il produit un vecteur dense unique de 1 024 dimensions, normalisé à la norme unité.
Fondé sur Perception Encoder, ImageBind et Uni3D, il charge des encodeurs audio et vision dans un espace partagé. Un MLP projette l’audio vers l’espace du Perception Encoder. Le modèle sert à la recherche sémantique intermodale, au retrieval pour un RAG multimodal, au clustering et au calcul de similarité par produit scalaire.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | encord-team |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC-SA 4.0 |
| Date de sortie | 19 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense, à vecteur unique et normalisé à la norme unité |
| Paramètres | 764 millions |
| Paramètres actifs | 764 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 55,8 % | 11ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB | 55,5 % | 2ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 53,8 % | 7ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB
Notre analyse
Forces. Son meilleur positionnement apparaît sur MVEB, où il figure en tête de tableau pour l’évaluation audio-visuelle couvrant le retrieval, la classification et le clustering. Le modèle obtient aussi un classement intermédiaire sur MVEB Video-Text, ce qui soutient les usages de rapprochement entre contenus vidéo et requêtes textuelles. L’espace partagé facilite les comparaisons entre modalités. La normalisation des vecteurs permet d’utiliser directement le produit scalaire comme mesure de similarité. Les poids ouverts autorisent l’auto-hébergement dans le respect de la licence.
Limites et points d'attention. Le positionnement est plus en retrait sur MVEB Video-Only que sur les deux autres tracks. Les trois benchmarks sont plafonnés et leurs scores sont peu discriminants, ce qui limite la portée des écarts de classement. Les vecteurs denses de 1 024 dimensions alourdissent l’index et le calcul de recherche par rapport à des représentations de dimension inférieure. La licence CC-BY-NC-SA 4.0 restreint les usages commerciaux et impose attribution ainsi que partage sous les mêmes conditions. Usages pertinents : recherche audio-visuelle, retrieval vidéo-texte, déduplication multimodale et clustering de contenus.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).