voyageai/voyage-3

Publié par Voyage AI le 18 septembre 2024, voyageai/voyage-3 est un modèle d’embedding dense qui représente chaque texte par un vecteur de 1 024 dimensions. Il sert à mesurer la proximité sémantique entre des contenus, sans générer de texte.

Publié par Voyage AI le 18 septembre 2024, voyageai/voyage-3 est un modèle d’embedding dense qui représente chaque texte par un vecteur de 1 024 dimensions. Il sert à mesurer la proximité sémantique entre des contenus, sans générer de texte.

Ses vecteurs peuvent alimenter un moteur de recherche sémantique, la récupération documentaire d’un système RAG, le rapprochement de textes similaires ou le clustering de corpus. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe derrière des générations plus récentes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
Date de sortie18 septembre 2024
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max32 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval74,1 %9ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal54,3 %29ᵉ / 208mteb✅ Mesuré
MTEB: Medical61,5 %15ᵉ / 158mteb✅ Mesuré
MTEB: Legal64,1 %5ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French46,0 %58ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German65,0 %27ᵉ / 209mteb✅ Mesuré
MTEB: Scandinavian58,6 %20ᵉ / 48mteb✅ Mesuré
MTEB: Instruction Following1,3 %28ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ voyageai/voyage-374 %

MTEB: RTEB German

nvidia/Nemotron-3-Embed…77 %
voyageai/voyage-4-large…77 %
▶ voyageai/voyage-365 %

Notre analyse

Forces. Les résultats MTEB placent voyageai/voyage-3 parmi les meilleurs modèles évalués en Long-context Retrieval et en recherche juridique générale. Il apparaît donc particulièrement adapté à la récupération d’informations dans des documents longs, des décisions, des textes législatifs, des questions-réponses juridiques et d’autres corpus spécialisés. Ses performances médicales et allemandes restent également solides, ce qui étend son intérêt aux contenus cliniques, biomédicaux, grand public et à plusieurs domaines professionnels en allemand. La représentation dense de 1 024 dimensions fournit un format vectoriel directement exploitable par les index de similarité.

Limites et points d’attention. Les évaluations Scandinavian et RTEB Legal sont moins favorables que ses meilleurs résultats, avec des positions plus éloignées de la tête du classement. Les performances peuvent donc varier sensiblement selon la langue, le corpus et le protocole de recherche juridique. Chaque passage indexé nécessite par ailleurs le stockage de 1 024 valeurs, un paramètre à intégrer dans le dimensionnement de l’index et des calculs de similarité. Compte tenu de son âge, une comparaison avec des embeddings plus récents est pertinente avant déploiement. Usages pertinents : recherche sémantique, RAG documentaire, similarité et clustering, notamment sur des corpus longs, juridiques ou médicaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).