voyageai/voyage-large-2-instruct

Publié par Voyage AI le 5 mai 2024, voyageai/voyage-large-2-instruct est un modèle d'embedding dense qui transforme les textes en vecteurs de 1 024 dimensions. Cette représentation permet de mesurer la proximité sémantique entre des requêtes, des passages ou des documents.

Publié par Voyage AI le 5 mai 2024, voyageai/voyage-large-2-instruct est un modèle d'embedding dense qui transforme les textes en vecteurs de 1 024 dimensions. Cette représentation permet de mesurer la proximité sémantique entre des requêtes, des passages ou des documents.

Le modèle peut servir à classer les résultats d'une recherche sémantique, à retrouver les passages injectés dans un système RAG, à détecter des contenus similaires ou à constituer des groupes thématiques par clustering. Son ancienneté d'environ deux ans est très importante à l'échelle de l'IA, ce qui le situe face aux modèles de sa période et le rend probablement dépassé aujourd'hui.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
Date de sortie5 mai 2024
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max16 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Reasoning Retrieval17,6 %9ᵉ / 29mteb✅ Mesuré
MTEB: RTEB French34,2 %82ᵉ / 218mteb✅ Mesuré
MTEB: Scandinavian59,7 %19ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Reasoning Retrieval

▶ voyageai/voyage-large-2…18 %

MTEB: Scandinavian

▶ voyageai/voyage-large-2…60 %
bge-m358 %

Notre analyse

Forces. voyageai/voyage-large-2-instruct se distingue surtout sur MTEB Reasoning Retrieval, où il figure dans le top 10. Ce résultat indique un positionnement compétitif, parmi les modèles évalués sur ce track, pour retrouver des informations à partir de requêtes réelles diverses et exigeantes. Sa représentation dense de 1 024 dimensions fournit des vecteurs détaillés, adaptés à la recherche sémantique, au rapprochement de contenus et à l'organisation de corpus. Les résultats sur MTEB Scandinavian montrent aussi une capacité exploitable sur des textes en danois, suédois et norvégien bokmål, même si le modèle n'y appartient pas au groupe de tête.

Limites et points d'attention. Les performances sur RTEB French placent le modèle dans la partie basse du classement pour la recherche en français, notamment sur des corpus juridiques et de connaissances générales. Le score absolu de MTEB Reasoning Retrieval reste par ailleurs faible malgré un rang relatif favorable. Les vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations de plus faible dimension. Son âge accroît enfin le risque d'un écart avec des embeddings plus récents. Usages pertinents : recherche sémantique et RAG sur des corpus validés par des tests internes, similarité documentaire et clustering thématique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).