ModernVBERT/bimodernvbert
ModernVBERT/bimodernvbert est un modèle d’embedding dense vision-langage publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres sont tous actifs. Son architecture bi-encodeur transforme séparément textes et images en vecteurs de 768 dimensions…
ModernVBERT/bimodernvbert est un modèle d’embedding dense vision-langage publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres sont tous actifs. Son architecture bi-encodeur transforme séparément textes et images en vecteurs de 768 dimensions afin d’en calculer la similarité.
Le modèle cible notamment la recherche visuelle et sémantique dans des documents multimodaux. Ses représentations peuvent alimenter la sélection de contenus pour un système RAG, le rapprochement entre requêtes textuelles et images, ainsi que le clustering de ressources similaires. Il produit des embeddings et non du texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ModernVBERT |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 1 octobre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 252 millions |
| Paramètres actifs | 252 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe V3 | 15,1 % | 30ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe V3
Notre analyse
Forces. L’association d’un encodeur de texte et d’un encodeur d’image permet de comparer directement des requêtes textuelles avec le contenu visuel de documents. Cette spécialisation répond aux besoins de retrieval dans des corpus d’entreprise multimodaux, notamment lorsque l’information pertinente se trouve dans une page, une figure ou une mise en forme visuelle. La représentation dense de 768 dimensions reste exploitable dans les infrastructures courantes de recherche vectorielle. La licence MIT autorise l’adaptation et l’auto-hébergement, tandis que Flash Attention 2 est recommandé sur les GPU compatibles pour optimiser l’exécution.
Limites et points d’attention. Sur ViDoRe V3, consacré à la recherche visuelle dans des documents d’entreprise multimodaux, le modèle se situe vers le bas du classement, ce qui invite à valider sa qualité sur les corpus visés avant un déploiement. Les vecteurs de 768 dimensions occupent davantage d’espace et demandent plus de calcul de similarité que des représentations de dimension inférieure. Son orientation vision-langage implique aussi une chaîne d’indexation adaptée aux textes et aux images. Usages pertinents : recherche visuelle de documents, retrieval multimodal, préparation de contexte pour le RAG et regroupement de contenus par similarité.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).