encord-team/ebind-audio-vision

Publié par encord-team le 19 novembre 2025, encord-team/ebind-audio-vision est un modèle d’embedding multimodal de 764 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC-SA 4.0. Il produit un vecteur dense unique de 1 024 dimensions, normalisé à la norme unité.

Publié par encord-team le 19 novembre 2025, encord-team/ebind-audio-vision est un modèle d’embedding multimodal de 764 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC-SA 4.0. Il produit un vecteur dense unique de 1 024 dimensions, normalisé à la norme unité.

Fondé sur Perception Encoder, ImageBind et Uni3D, il charge des encodeurs audio et vision dans un espace partagé. Un MLP projette l’audio vers l’espace du Perception Encoder. Le modèle sert à la recherche sémantique intermodale, au retrieval pour un RAG multimodal, au clustering et au calcul de similarité par produit scalaire.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurencord-team
Poids🟢 Poids ouverts
LicenceCC-BY-NC-SA 4.0
Date de sortie19 novembre 2025
Dimension du vecteur1 024
Représentationdense, à vecteur unique et normalisé à la norme unité
Paramètres764 millions
Paramètres actifs764 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only55,8 %11ᵉ / 32mteb✅ Mesuré
MTEB: MVEB55,5 %2ᵉ / 15mteb✅ Mesuré
MTEB: MVEB Video-Text53,8 %7ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

▶ encord-team/ebind-audio…56 %

MTEB: MVEB

▶ encord-team/ebind-audio…55 %

Notre analyse

Forces. Son meilleur positionnement apparaît sur MVEB, où il figure en tête de tableau pour l’évaluation audio-visuelle couvrant le retrieval, la classification et le clustering. Le modèle obtient aussi un classement intermédiaire sur MVEB Video-Text, ce qui soutient les usages de rapprochement entre contenus vidéo et requêtes textuelles. L’espace partagé facilite les comparaisons entre modalités. La normalisation des vecteurs permet d’utiliser directement le produit scalaire comme mesure de similarité. Les poids ouverts autorisent l’auto-hébergement dans le respect de la licence.

Limites et points d'attention. Le positionnement est plus en retrait sur MVEB Video-Only que sur les deux autres tracks. Les trois benchmarks sont plafonnés et leurs scores sont peu discriminants, ce qui limite la portée des écarts de classement. Les vecteurs denses de 1 024 dimensions alourdissent l’index et le calcul de recherche par rapport à des représentations de dimension inférieure. La licence CC-BY-NC-SA 4.0 restreint les usages commerciaux et impose attribution ainsi que partage sous les mêmes conditions. Usages pertinents : recherche audio-visuelle, retrieval vidéo-texte, déduplication multimodale et clustering de contenus.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).