ModernVBERT/bimodernvbert

ModernVBERT/bimodernvbert est un modèle d’embedding dense vision-langage publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres sont tous actifs. Son architecture bi-encodeur transforme séparément textes et images en vecteurs de 768 dimensions…

ModernVBERT/bimodernvbert est un modèle d’embedding dense vision-langage publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres sont tous actifs. Son architecture bi-encodeur transforme séparément textes et images en vecteurs de 768 dimensions afin d’en calculer la similarité.

Le modèle cible notamment la recherche visuelle et sémantique dans des documents multimodaux. Ses représentations peuvent alimenter la sélection de contenus pour un système RAG, le rapprochement entre requêtes textuelles et images, ainsi que le clustering de ressources similaires. Il produit des embeddings et non du texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurModernVBERT
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie1 octobre 2025
Dimension du vecteur768
Représentationdense
Paramètres252 millions
Paramètres actifs252 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe V315,1 %30ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. L’association d’un encodeur de texte et d’un encodeur d’image permet de comparer directement des requêtes textuelles avec le contenu visuel de documents. Cette spécialisation répond aux besoins de retrieval dans des corpus d’entreprise multimodaux, notamment lorsque l’information pertinente se trouve dans une page, une figure ou une mise en forme visuelle. La représentation dense de 768 dimensions reste exploitable dans les infrastructures courantes de recherche vectorielle. La licence MIT autorise l’adaptation et l’auto-hébergement, tandis que Flash Attention 2 est recommandé sur les GPU compatibles pour optimiser l’exécution.

Limites et points d’attention. Sur ViDoRe V3, consacré à la recherche visuelle dans des documents d’entreprise multimodaux, le modèle se situe vers le bas du classement, ce qui invite à valider sa qualité sur les corpus visés avant un déploiement. Les vecteurs de 768 dimensions occupent davantage d’espace et demandent plus de calcul de similarité que des représentations de dimension inférieure. Son orientation vision-langage implique aussi une chaîne d’indexation adaptée aux textes et aux images. Usages pertinents : recherche visuelle de documents, retrieval multimodal, préparation de contexte pour le RAG et regroupement de contenus par similarité.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).