voyageai/voyage-multilingual-2

Publié par Voyage AI le 10 juin 2024, voyageai/voyage-multilingual-2 est un modèle d’embedding multilingue à représentation dense. Il convertit les textes en vecteurs de 1 024 dimensions, destinés à mesurer leur proximité sémantique plutôt qu’à générer du contenu.

Publié par Voyage AI le 10 juin 2024, voyageai/voyage-multilingual-2 est un modèle d’embedding multilingue à représentation dense. Il convertit les textes en vecteurs de 1 024 dimensions, destinés à mesurer leur proximité sémantique plutôt qu’à générer du contenu.

Le modèle sert notamment à indexer des documents pour la recherche sémantique, à retrouver des passages dans un système RAG, à détecter des contenus similaires et à regrouper des textes par clustering. Âgé de près de deux ans, il appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents de sa catégorie.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
Date de sortie10 juin 2024
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max32 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval79,2 %3ᵉ / 170mteb✅ Mesuré
MTEB: Medical61,0 %20ᵉ / 158mteb✅ Mesuré
MTEB: RTEB French48,1 %51ᵉ / 218mteb✅ Mesuré
MTEB: Scandinavian61,2 %15ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ voyageai/voyage-multili…79 %

MTEB: Scandinavian

▶ voyageai/voyage-multili…61 %

Notre analyse

Forces. Le principal point fort de voyageai/voyage-multilingual-2 ressort du track MTEB Long-context Retrieval, où il figure parmi les tout meilleurs modèles évalués. Il se montre donc particulièrement adapté à la recherche de passages pertinents dans des contenus longs, sur des tâches synthétiques comme réelles. Ses résultats en Medical le placent également dans le haut du classement pour la recherche d’informations cliniques, biomédicales et de santé grand public. Sur Scandinavian, il obtient une position solide pour les textes danois, suédois et norvégiens bokmål. Sa représentation dense fournit des vecteurs directement exploitables dans un index de similarité.

Limites et points d'attention. Les performances en français sont moins convaincantes sur RTEB French, avec un résultat sensiblement inférieur à ceux observés sur le contexte long, le médical ou les langues scandinaves. Ce track couvre notamment la recherche dans des contenus juridiques et de connaissances générales, domaines où le modèle apparaît moins compétitif. Les vecteurs de 1 024 dimensions impliquent aussi des index plus volumineux et davantage de calcul qu’avec des embeddings de dimension inférieure. Son ancienneté élevée rend enfin probable un déclassement face aux générations récentes. Usages pertinents : recherche multilingue, RAG sur documents longs, recherche médicale, similarité sémantique et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).