encord-team/ebind-full

encord-team/ebind-full est un modèle d’embedding multimodal de 2 milliards de paramètres actifs, développé par encord-team. Il charge tous ses encodeurs et accepte le texte, les images, la vidéo, l’audio et les nuages de points 3D. Chaque entrée est convertie en un vecteur dense unique…

encord-team/ebind-full est un modèle d’embedding multimodal de 2 milliards de paramètres actifs, développé par encord-team. Il charge tous ses encodeurs et accepte le texte, les images, la vidéo, l’audio et les nuages de points 3D. Chaque entrée est convertie en un vecteur dense unique de 1 024 dimensions et de norme unitaire.

Ses poids sont ouverts sous licence CC-BY-NC-SA 4.0. Le modèle sert à la recherche sémantique intermodale, à la récupération de contenus pour le RAG, au clustering et au calcul de similarité par produit scalaire ou similarité cosinus. Il ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurencord-team
Poids🟢 Poids ouverts
LicenceCC-BY-NC-SA 4.0
Date de sortie19 novembre 2025
Dimension du vecteur1 024
Représentationdense multimodale à vecteur unique de dimension 1024
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only55,8 %11ᵉ / 32mteb✅ Mesuré
MTEB: MVEB55,5 %2ᵉ / 15mteb✅ Mesuré
MTEB: Image-Text, Lite55,2 %9ᵉ / 49mteb✅ Mesuré
MTEB: MVEB Video-Text53,8 %7ᵉ / 23mteb✅ Mesuré
MTEB: MAEB Audio-Only44,6 %16ᵉ / 60mteb✅ Mesuré
MTEB: MAEB32,8 %15ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. encord-team/ebind-full se place dans le groupe de tête de MVEB pour les tâches combinant vidéo et audio, notamment la recherche, la classification et le clustering. Il figure aussi dans le top 10 d’Image-Text, Lite, consacré aux représentations multilingues d’images. Les résultats en vidéo seule et en association vidéo-texte confirment son intérêt pour la recherche intermodale. L’espace partagé de Perception Encoder, ImageBind et Uni3D rapproche plusieurs types de contenus dans une même représentation. Les poids ouverts facilitent l’auto-hébergement.

Limites et points d’attention. Plusieurs tracks vidéo sont plafonnés, ce qui rend leurs scores peu discriminants entre les modèles concernés. Les performances audio sont moins convaincantes : MAEB se situe dans la partie basse du classement, tandis que MAEB Audio-Only reste hors du groupe de tête. Le chargement de tous les encodeurs et les 2 milliards de paramètres actifs alourdissent les besoins de déploiement. La licence CC-BY-NC-SA 4.0 exclut les usages commerciaux et impose attribution et partage sous la même licence. Usages pertinents : recherche multimodale, indexation vidéo, rapprochement image-texte, clustering et récupération de contexte pour un RAG non commercial.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).