encord-team/ebind-points-vision
Publié le 19 novembre 2025 par encord-team, encord-team/ebind-points-vision est un modèle d'embedding multimodal de 2 milliards de paramètres, tous actifs. Cette version mobilise des encodeurs pour la vision et les nuages de points 3D, puis projette chaque entrée dans un vecteur dense de…
Publié le 19 novembre 2025 par encord-team, encord-team/ebind-points-vision est un modèle d'embedding multimodal de 2 milliards de paramètres, tous actifs. Cette version mobilise des encodeurs pour la vision et les nuages de points 3D, puis projette chaque entrée dans un vecteur dense de 1024 dimensions, normalisé à norme unitaire.
Son espace partagé permet de comparer des contenus entre modalités par produit scalaire, équivalent ici à la similarité cosinus. Le modèle peut ainsi servir à l'indexation, à la recherche sémantique, au retrieval pour un système RAG, à la détection de similarités et au clustering. Sa licence CC-BY-NC-SA 4.0 autorise la réutilisation sous conditions, hors usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | encord-team |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC-SA 4.0 |
| Date de sortie | 19 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | vecteurs denses unit-norm de 1024 dimensions |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text,image,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 55,8 % | 10ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 53,8 % | 6ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB Video-Text
Notre analyse
Forces. encord-team/ebind-points-vision se classe dans le top 10 des deux tracks MVEB évalués par MTEB. Son meilleur positionnement relatif concerne MVEB Video-Text, qui couvre notamment la recherche, la classification et le clustering entre texte et vidéo. Le modèle est également compétitif sur MVEB Video-Only pour la classification et la classification de paires. Son architecture associe Perception Encoder, ImageBind et Uni3D, tandis qu'un MLP projette les représentations des nuages de points 3D dans l'espace de Perception Encoder. La normalisation unitaire simplifie le calcul de similarité, un produit scalaire suffisant pour obtenir la similarité cosinus.
Limites et points d'attention. Le positionnement sur MVEB Video-Only est moins favorable que sur MVEB Video-Text, même s'il reste dans le top 10. Les 2 milliards de paramètres actifs impliquent le chargement de l'ensemble du modèle lors de l'inférence. Les vecteurs denses de 1024 dimensions déterminent aussi la taille des index et le coût des comparaisons à grande échelle. Enfin, la clause non commerciale de la licence CC-BY-NC-SA 4.0 restreint les déploiements commerciaux et impose le partage sous la même licence des adaptations distribuées. Usages pertinents : recherche multimodale, rapprochement vidéo-texte, similarité visuelle ou 3D, classification, clustering et retrieval pour RAG.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).