voyageai/voyage-4-large

Publié le 15 janvier 2026 par Voyage AI, voyageai/voyage-4-large est un modèle d’embedding dense qui convertit les textes en vecteurs de 1 024 dimensions. Ses évaluations couvrent notamment le français et l’allemand, ainsi que des contenus financiers, médicaux et juridiques.

Publié le 15 janvier 2026 par Voyage AI, voyageai/voyage-4-large est un modèle d’embedding dense qui convertit les textes en vecteurs de 1 024 dimensions. Ses évaluations couvrent notamment le français et l’allemand, ainsi que des contenus financiers, médicaux et juridiques.

Ces représentations numériques servent à comparer le sens de requêtes et de documents. Le modèle peut alimenter un moteur de recherche sémantique, la sélection de passages pour un système RAG, la mesure de similarité ou le regroupement de contenus par proximité thématique.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
Date de sortie15 janvier 2026
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max32 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal61,6 %14ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare71,8 %3ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance86,1 %4ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French65,9 %3ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German72,1 %10ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ voyageai/voyage-4-large86 %

MTEB: RTEB German

nvidia/Nemotron-3-Embed…77 %
voyageai/voyage-4-large…77 %
▶ voyageai/voyage-4-large72 %
telepix/PIXIE-Rune-v1.070 %

Notre analyse

Forces. voyageai/voyage-4-large se distingue surtout sur les tâches de retrieval spécialisées. Ses meilleurs résultats RTEB le placent parmi les modèles les mieux classés en finance et en santé, deux domaines où la correspondance entre une requête et des documents techniques est centrale. Il figure aussi parmi les meilleurs en recherche en français et obtient un classement de premier plan en allemand, sur des corpus couvrant notamment le droit, la santé et l’entreprise. La représentation dense de 1 024 dimensions fournit un format unique pour indexer les documents, calculer leur similarité et former des groupes thématiques.

Limites et points d'attention. Le track juridique constitue son résultat relatif le moins favorable parmi les évaluations communiquées, avec un classement inférieur à ceux observés en finance, en santé, en français et en allemand. Les performances restent donc à valider sur les corpus juridiques visés, notamment lorsque la terminologie, les types de documents ou les critères de pertinence diffèrent des benchmarks. Des vecteurs de 1 024 dimensions imposent aussi de dimensionner le stockage de l’index et les calculs de similarité en fonction du volume documentaire. Usages pertinents : recherche sémantique spécialisée, retrieval pour RAG, rapprochement de documents et clustering multilingue.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).