encord-team/ebind-full
encord-team/ebind-full est un modèle d’embedding multimodal de 2 milliards de paramètres actifs, développé par encord-team. Il charge tous ses encodeurs et accepte le texte, les images, la vidéo, l’audio et les nuages de points 3D. Chaque entrée est convertie en un vecteur dense unique…
encord-team/ebind-full est un modèle d’embedding multimodal de 2 milliards de paramètres actifs, développé par encord-team. Il charge tous ses encodeurs et accepte le texte, les images, la vidéo, l’audio et les nuages de points 3D. Chaque entrée est convertie en un vecteur dense unique de 1 024 dimensions et de norme unitaire.
Ses poids sont ouverts sous licence CC-BY-NC-SA 4.0. Le modèle sert à la recherche sémantique intermodale, à la récupération de contenus pour le RAG, au clustering et au calcul de similarité par produit scalaire ou similarité cosinus. Il ne génère pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | encord-team |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC-SA 4.0 |
| Date de sortie | 19 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense multimodale à vecteur unique de dimension 1024 |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 55,8 % | 11ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB | 55,5 % | 2ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 55,2 % | 9ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 53,8 % | 7ᵉ / 23 | mteb | ✅ Mesuré |
| MTEB: MAEB Audio-Only | 44,6 % | 16ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MAEB | 32,8 % | 15ᵉ / 21 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB
Notre analyse
Forces. encord-team/ebind-full se place dans le groupe de tête de MVEB pour les tâches combinant vidéo et audio, notamment la recherche, la classification et le clustering. Il figure aussi dans le top 10 d’Image-Text, Lite, consacré aux représentations multilingues d’images. Les résultats en vidéo seule et en association vidéo-texte confirment son intérêt pour la recherche intermodale. L’espace partagé de Perception Encoder, ImageBind et Uni3D rapproche plusieurs types de contenus dans une même représentation. Les poids ouverts facilitent l’auto-hébergement.
Limites et points d’attention. Plusieurs tracks vidéo sont plafonnés, ce qui rend leurs scores peu discriminants entre les modèles concernés. Les performances audio sont moins convaincantes : MAEB se situe dans la partie basse du classement, tandis que MAEB Audio-Only reste hors du groupe de tête. Le chargement de tous les encodeurs et les 2 milliards de paramètres actifs alourdissent les besoins de déploiement. La licence CC-BY-NC-SA 4.0 exclut les usages commerciaux et impose attribution et partage sous la même licence. Usages pertinents : recherche multimodale, indexation vidéo, rapprochement image-texte, clustering et récupération de contexte pour un RAG non commercial.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).