voyageai/voyage-2

Publié par Voyage AI le 29 octobre 2023, voyageai/voyage-2 est un modèle d’embedding dense qui transforme chaque texte en un vecteur de 1 024 dimensions. Il appartient à une génération désormais ancienne à l’échelle de l’IA, proche de trois ans.

Publié par Voyage AI le 29 octobre 2023, voyageai/voyage-2 est un modèle d’embedding dense qui transforme chaque texte en un vecteur de 1 024 dimensions. Il appartient à une génération désormais ancienne à l’échelle de l’IA, proche de trois ans.

Ces représentations numériques servent à comparer la proximité sémantique entre requêtes, passages ou documents. Le modèle peut ainsi alimenter un moteur de recherche sémantique, la sélection de contexte dans un système RAG, le regroupement de contenus similaires ou des tâches de détection de proximité. Il ne produit pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
Date de sortie29 octobre 2023
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max4 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Scandinavian52,2 %32ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. voyageai/voyage-2 fournit une représentation dense de taille fixe, directement exploitable pour calculer des similarités et construire un index vectoriel. Sa sortie en 1 024 dimensions peut conserver une représentation relativement détaillée des textes, adaptée à la recherche sémantique, au classement de passages pour le RAG et au clustering. Deux sources de données concordantes étayent son évaluation disponible.

Limites et points d’attention. Sur le track MTEB Scandinavian, consacré au danois, au suédois et au norvégien bokmål, le modèle se situe dans la partie basse du classement. Il ne constitue donc pas un choix de premier plan pour cette couverture linguistique face aux autres modèles évalués. Les vecteurs de 1 024 dimensions rendent aussi l’index plus volumineux et les comparaisons plus coûteuses que des représentations moins dimensionnées. Son ancienneté est très importante dans ce secteur : les modèles de sa période sont probablement dépassés et souvent retirés des catalogues actuels. Usages pertinents : maintien d’un index existant, recherche sémantique, RAG ou clustering lorsque la compatibilité avec ses vecteurs prime sur l’adoption d’un modèle plus récent.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).