voyageai/voyage-multimodal-3
Publié par Voyage AI le 10 novembre 2024, voyageai/voyage-multimodal-3 est un modèle d’embedding multimodal et multilingue. Il produit des représentations denses de 1 024 dimensions, adaptées à l’indexation conjointe d’images, de textes et de documents visuels. Sa licence MIT autorise…
Publié par Voyage AI le 10 novembre 2024, voyageai/voyage-multimodal-3 est un modèle d’embedding multimodal et multilingue. Il produit des représentations denses de 1 024 dimensions, adaptées à l’indexation conjointe d’images, de textes et de documents visuels. Sa licence MIT autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.
Le modèle sert à la recherche sémantique, à la récupération de contenus pour le RAG, au calcul de similarité et au clustering. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe face à une génération de modèles désormais probablement dépassée.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 10 novembre 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 75,7 % | 36ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: Jina Visual Document Retrieval | 69,5 % | 3ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: Image only | 67,3 % | 2ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 63,8 % | 2ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 63,6 % | 2ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 59,7 % | 5ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: Jina Visual Document Retrieval
Notre analyse
Forces. voyageai/voyage-multimodal-3 se distingue surtout sur les tâches centrées sur l’image. Il figure parmi les meilleurs modèles évalués en embedding d’images seules, notamment pour la recherche, la classification et le clustering. Ses résultats sont également solides sur les tâches associant images et textes, en anglais comme dans un cadre multilingue couvrant de nombreuses langues. Le modèle reste bien placé sur la déclinaison allégée de cette évaluation. Sa licence MIT constitue un atout pratique pour l’auto-hébergement, tandis que ses vecteurs denses de 1 024 dimensions offrent une représentation standardisée pour les bases vectorielles.
Limites et points d’attention. Les performances sont nettement moins convaincantes sur ViDoRe V1&V2, où le modèle se situe dans le dernier quart du classement pour la recherche dans des documents visuels variés. Son bon rang sur Jina Visual Document Retrieval doit être relativisé par un groupe de comparaison limité à cinq modèles. Une dimension de 1 024 implique aussi des index plus lourds et des recherches plus coûteuses que des représentations plus compactes. Compte tenu de son ancienneté, le modèle est probablement dépassé et peut avoir été retiré du catalogue de l’éditeur. Usages pertinents : recherche multimodale, similarité image-texte, classification d’images, clustering et RAG sur des corpus visuels multilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).