voyageai/voyage-4

Publié par Voyage AI le 15 janvier 2026, voyageai/voyage-4 est un modèle d’embedding dense. Il transforme chaque texte en un vecteur de 1 024 dimensions, représentation numérique destinée à mesurer la proximité sémantique entre requêtes, passages ou documents.

Publié par Voyage AI le 15 janvier 2026, voyageai/voyage-4 est un modèle d’embedding dense. Il transforme chaque texte en un vecteur de 1 024 dimensions, représentation numérique destinée à mesurer la proximité sémantique entre requêtes, passages ou documents.

Le modèle sert notamment à classer des résultats de recherche sémantique, à retrouver des sources dans un système RAG, à détecter des contenus similaires et à regrouper des corpus par clustering. Ses évaluations RTEB couvrent le français et l’allemand, ainsi que plusieurs domaines spécialisés, notamment la finance, la santé et le droit.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVoyage AI
Poids🟢 Poids ouverts
Date de sortie15 janvier 2026
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max32 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal59,7 %18ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare68,3 %6ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance83,7 %6ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French60,9 %9ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German70,8 %13ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ voyageai/voyage-484 %

MTEB: RTEB German

nvidia/Nemotron-3-Embed…77 %
voyageai/voyage-4-large…77 %
▶ voyageai/voyage-471 %
telepix/PIXIE-Rune-v1.070 %

Notre analyse

Forces. voyageai/voyage-4 se distingue surtout sur les tâches de retrieval spécialisées. Ses meilleurs résultats RTEB concernent la finance et la santé, où il figure dans le top 10, ce qui indique une aptitude marquée à rapprocher questions, réponses et documents métier pertinents. Le modèle se classe également dans le top 10 en français sur des corpus juridiques et de connaissances générales. Son résultat en allemand, évalué dans les domaines juridique, médical et commercial, confirme des performances solides au-delà d’une seule langue. La représentation dense de 1 024 dimensions fournit un format vectoriel uniforme pour l’indexation, la similarité et le clustering.

Limites et points d’attention. Le track juridique constitue son résultat relatif le moins favorable parmi les évaluations fournies, derrière la finance, la santé, le français et l’allemand. Son classement y reste néanmoins élevé au regard du nombre de modèles comparés. Les performances varient donc selon la langue et la spécialisation du corpus, ce qui justifie une évaluation sur les documents et requêtes de la cible. Chaque embedding comportant 1 024 valeurs, le stockage et le calcul de similarité doivent être dimensionnés en conséquence lors d’une indexation à grande échelle. Usages pertinents : recherche sémantique multilingue, retrieval pour RAG, recherche spécialisée en finance ou en santé, similarité documentaire et clustering de corpus.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).