voyageai/voyage-multimodal-3

Publié par Voyage AI le 10 novembre 2024, voyageai/voyage-multimodal-3 est un modèle d’embedding multimodal et multilingue. Il produit des représentations denses de 1 024 dimensions, adaptées à l’indexation conjointe d’images, de textes et de documents visuels. Sa licence MIT autorise…

Publié par Voyage AI le 10 novembre 2024, voyageai/voyage-multimodal-3 est un modèle d’embedding multimodal et multilingue. Il produit des représentations denses de 1 024 dimensions, adaptées à l’indexation conjointe d’images, de textes et de documents visuels. Sa licence MIT autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.

Le modèle sert à la recherche sémantique, à la récupération de contenus pour le RAG, au calcul de similarité et au clustering. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe face à une génération de modèles désormais probablement dépassée.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie10 novembre 2024
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)75,7 %36ᵉ / 48mteb✅ Mesuré
MTEB: Jina Visual Document Retrieval69,5 %3ᵉ / 5mteb✅ Mesuré
MTEB: Image only67,3 %2ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, Multilingual63,8 %2ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, English63,6 %2ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite59,7 %5ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

nanovdr/NanoVDR-S-Multi77 %
▶ voyageai/voyage-multimo…76 %

MTEB: Jina Visual Document Retrieval

▶ voyageai/voyage-multimo…70 %

Notre analyse

Forces. voyageai/voyage-multimodal-3 se distingue surtout sur les tâches centrées sur l’image. Il figure parmi les meilleurs modèles évalués en embedding d’images seules, notamment pour la recherche, la classification et le clustering. Ses résultats sont également solides sur les tâches associant images et textes, en anglais comme dans un cadre multilingue couvrant de nombreuses langues. Le modèle reste bien placé sur la déclinaison allégée de cette évaluation. Sa licence MIT constitue un atout pratique pour l’auto-hébergement, tandis que ses vecteurs denses de 1 024 dimensions offrent une représentation standardisée pour les bases vectorielles.

Limites et points d’attention. Les performances sont nettement moins convaincantes sur ViDoRe V1&V2, où le modèle se situe dans le dernier quart du classement pour la recherche dans des documents visuels variés. Son bon rang sur Jina Visual Document Retrieval doit être relativisé par un groupe de comparaison limité à cinq modèles. Une dimension de 1 024 implique aussi des index plus lourds et des recherches plus coûteuses que des représentations plus compactes. Compte tenu de son ancienneté, le modèle est probablement dépassé et peut avoir été retiré du catalogue de l’éditeur. Usages pertinents : recherche multimodale, similarité image-texte, classification d’images, clustering et RAG sur des corpus visuels multilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).