voyageai/voyage-large-2

Publié par Voyage AI le 29 octobre 2023, voyageai/voyage-large-2 est un modèle d’embedding dense. Il convertit les textes en vecteurs de 1 536 dimensions, destinés à représenter leur proximité sémantique.

Publié par Voyage AI le 29 octobre 2023, voyageai/voyage-large-2 est un modèle d’embedding dense. Il convertit les textes en vecteurs de 1 536 dimensions, destinés à représenter leur proximité sémantique.

Ces vecteurs peuvent alimenter un moteur de recherche sémantique, la sélection de passages pour un système RAG, la mesure de similarité entre textes ou leur regroupement par clustering. Le modèle ne génère pas de texte, son rôle consiste à produire des représentations numériques indexables et comparables.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
Date de sortie29 octobre 2023
Dimension du vecteur1 536
Représentationdense
Longueur de séquence max16 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Scandinavian53,3 %31ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. voyageai/voyage-large-2 fournit une représentation dense de 1 536 dimensions, exploitable pour rapprocher des requêtes et des documents selon leur sens plutôt que par simple correspondance de mots. Son évaluation MTEB Scandinavian confirme une capacité à traiter des textes en danois, suédois et norvégien bokmål. Cette caractéristique peut servir à la recherche sémantique, au RAG et au clustering sur des corpus scandinaves.

Limites et points d’attention. Sur MTEB Scandinavian, le modèle se situe dans la partie basse du classement, ce qui invite à ne pas le considérer comme une référence actuelle pour ces langues. Sa sortie en 2023 le rend très ancien à l’échelle de l’IA, par comparaison avec les modèles de sa période, et il est probablement dépassé ainsi que souvent retiré du catalogue de l’éditeur aujourd’hui. Les vecteurs de 1 536 dimensions imposent aussi un volume d’index et un coût de recherche à prendre en compte lors d’un déploiement à grande échelle. Usages pertinents : maintenance d’un index existant, recherche sémantique, RAG, similarité et clustering lorsque la compatibilité avec ce format vectoriel est prioritaire.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).