ModernVBERT/modernvbert-embed

ModernVBERT/modernvbert-embed est un modèle d’embedding dense bi-encodeur publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres, tous actifs, produisent des vecteurs de 768 dimensions.

ModernVBERT/modernvbert-embed est un modèle d’embedding dense bi-encodeur publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres, tous actifs, produisent des vecteurs de 768 dimensions.

Cet encodeur vision-langage représente séparément textes et images dans un espace vectoriel afin de calculer leur similarité. Il peut ainsi soutenir la recherche sémantique et visuelle, la sélection de contenus pour un système RAG, le rapprochement d’éléments similaires et leur clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurModernVBERT
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie1 octobre 2025
Dimension du vecteur768
Représentationdense (bi-encodeur)
Paramètres252 millions
Paramètres actifs252 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe V314,7 %31ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. ModernVBERT/modernvbert-embed est conçu comme un encodeur généraliste d’images et de textes plutôt que comme un modèle spécialisé dans une tâche précise. L’alignement entre modalités combine un objectif MLM et un apprentissage contrastif. Son architecture bi-encodeur permet de calculer séparément les représentations, puis de comparer rapidement leurs vecteurs, un fonctionnement adapté à l’indexation et à la recherche à grande échelle. La sortie de 768 dimensions offre un format maîtrisé pour le stockage des index, tandis que la licence MIT facilite l’intégration, la modification et le déploiement dans des infrastructures contrôlées.

Limites et points d’attention. Sur ViDoRe V3, consacré à la recherche visuelle dans des documents d’entreprise multimodaux, le modèle se situe vers le bas du classement. Ce résultat invite à valider sa pertinence sur les corpus financiers et, plus largement, sur les documents complexes mêlant texte et éléments visuels. Son positionnement généraliste implique également qu’il n’est pas optimisé pour une tâche métier particulière. Usages pertinents : recherche sémantique texte-image, indexation multimodale, sélection de contenus pour le RAG, similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).