encord-team/ebind-points-vision

Publié le 19 novembre 2025 par encord-team, encord-team/ebind-points-vision est un modèle d'embedding multimodal de 2 milliards de paramètres, tous actifs. Cette version mobilise des encodeurs pour la vision et les nuages de points 3D, puis projette chaque entrée dans un vecteur dense de…

Publié le 19 novembre 2025 par encord-team, encord-team/ebind-points-vision est un modèle d'embedding multimodal de 2 milliards de paramètres, tous actifs. Cette version mobilise des encodeurs pour la vision et les nuages de points 3D, puis projette chaque entrée dans un vecteur dense de 1024 dimensions, normalisé à norme unitaire.

Son espace partagé permet de comparer des contenus entre modalités par produit scalaire, équivalent ici à la similarité cosinus. Le modèle peut ainsi servir à l'indexation, à la recherche sémantique, au retrieval pour un système RAG, à la détection de similarités et au clustering. Sa licence CC-BY-NC-SA 4.0 autorise la réutilisation sous conditions, hors usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurencord-team
Poids🟢 Poids ouverts
LicenceCC-BY-NC-SA 4.0
Date de sortie19 novembre 2025
Dimension du vecteur1 024
Représentationvecteurs denses unit-norm de 1024 dimensions
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text,image,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only55,8 %10ᵉ / 32mteb✅ Mesuré
MTEB: MVEB Video-Text53,8 %6ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

▶ encord-team/ebind-point…56 %

MTEB: MVEB Video-Text

▶ encord-team/ebind-point…54 %

Notre analyse

Forces. encord-team/ebind-points-vision se classe dans le top 10 des deux tracks MVEB évalués par MTEB. Son meilleur positionnement relatif concerne MVEB Video-Text, qui couvre notamment la recherche, la classification et le clustering entre texte et vidéo. Le modèle est également compétitif sur MVEB Video-Only pour la classification et la classification de paires. Son architecture associe Perception Encoder, ImageBind et Uni3D, tandis qu'un MLP projette les représentations des nuages de points 3D dans l'espace de Perception Encoder. La normalisation unitaire simplifie le calcul de similarité, un produit scalaire suffisant pour obtenir la similarité cosinus.

Limites et points d'attention. Le positionnement sur MVEB Video-Only est moins favorable que sur MVEB Video-Text, même s'il reste dans le top 10. Les 2 milliards de paramètres actifs impliquent le chargement de l'ensemble du modèle lors de l'inférence. Les vecteurs denses de 1024 dimensions déterminent aussi la taille des index et le coût des comparaisons à grande échelle. Enfin, la clause non commerciale de la licence CC-BY-NC-SA 4.0 restreint les déploiements commerciaux et impose le partage sous la même licence des adaptations distribuées. Usages pertinents : recherche multimodale, rapprochement vidéo-texte, similarité visuelle ou 3D, classification, clustering et retrieval pour RAG.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).