nomic-ai/colnomic-embed-multimodal-7b
Publié par Nomic AI le 31 mars 2025, nomic-ai/colnomic-embed-multimodal-7b est un modèle d’embedding multimodal de 7 milliards de paramètres, dérivé de Qwen2.5-VL 7B Instruct. Il produit des représentations multi-vecteurs de dimension 128, avec une variante dense également mentionnée.
Publié par Nomic AI le 31 mars 2025, nomic-ai/colnomic-embed-multimodal-7b est un modèle d’embedding multimodal de 7 milliards de paramètres, dérivé de Qwen2.5-VL 7B Instruct. Il produit des représentations multi-vecteurs de dimension 128, avec une variante dense également mentionnée.
Le modèle traite de manière unifiée le texte, les images entrelacées et les images de pages. Multilingue, mais plus performant en anglais, il cible la recherche sémantique et documentaire visuelle, le RAG, la similarité et le clustering. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Nomic AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 31 mars 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur ; une variante dense est également mentionnée |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 128 000 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 81,3 % | 24ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 57,3 % | 14ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Son principal atout réside dans la recherche au sein de documents visuels et multimodaux, notamment lorsque les informations sont réparties entre texte, images et pages numérisées. Sur ViDoRe V3, consacré à des documents d’entreprise multimodaux couvrant notamment la finance, il se place dans la première moitié des modèles évalués. La représentation multi-vecteur convient aux mécanismes de retrieval fin, tandis que la sortie de dimension 128 peut limiter la taille de chaque vecteur. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement.
Limites et points d’attention. Sur ViDoRe V1&V2, qui couvre différents types et domaines documentaires, le modèle se situe au milieu du classement. Son avantage multilingue doit être nuancé par une efficacité annoncée comme supérieure sur les contenus anglais. Malgré la dimension compacte, l’approche multi-vecteur peut multiplier les représentations par document, alourdir l’index et rendre la recherche plus coûteuse qu’avec une unique représentation dense. Sorti il y a environ un an, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche documentaire visuelle, RAG multimodal, similarité et clustering de corpus mêlant textes et images.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).