voyageai/voyage-4
Publié par Voyage AI le 15 janvier 2026, voyageai/voyage-4 est un modèle d’embedding dense. Il transforme chaque texte en un vecteur de 1 024 dimensions, représentation numérique destinée à mesurer la proximité sémantique entre requêtes, passages ou documents.
Publié par Voyage AI le 15 janvier 2026, voyageai/voyage-4 est un modèle d’embedding dense. Il transforme chaque texte en un vecteur de 1 024 dimensions, représentation numérique destinée à mesurer la proximité sémantique entre requêtes, passages ou documents.
Le modèle sert notamment à classer des résultats de recherche sémantique, à retrouver des sources dans un système RAG, à détecter des contenus similaires et à regrouper des corpus par clustering. Ses évaluations RTEB couvrent le français et l’allemand, ainsi que plusieurs domaines spécialisés, notamment la finance, la santé et le droit.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 15 janvier 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 32 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 59,7 % | 18ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 68,3 % | 6ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 83,7 % | 6ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 60,9 % | 9ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 70,8 % | 13ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB German
Notre analyse
Forces. voyageai/voyage-4 se distingue surtout sur les tâches de retrieval spécialisées. Ses meilleurs résultats RTEB concernent la finance et la santé, où il figure dans le top 10, ce qui indique une aptitude marquée à rapprocher questions, réponses et documents métier pertinents. Le modèle se classe également dans le top 10 en français sur des corpus juridiques et de connaissances générales. Son résultat en allemand, évalué dans les domaines juridique, médical et commercial, confirme des performances solides au-delà d’une seule langue. La représentation dense de 1 024 dimensions fournit un format vectoriel uniforme pour l’indexation, la similarité et le clustering.
Limites et points d’attention. Le track juridique constitue son résultat relatif le moins favorable parmi les évaluations fournies, derrière la finance, la santé, le français et l’allemand. Son classement y reste néanmoins élevé au regard du nombre de modèles comparés. Les performances varient donc selon la langue et la spécialisation du corpus, ce qui justifie une évaluation sur les documents et requêtes de la cible. Chaque embedding comportant 1 024 valeurs, le stockage et le calcul de similarité doivent être dimensionnés en conséquence lors d’une indexation à grande échelle. Usages pertinents : recherche sémantique multilingue, retrieval pour RAG, recherche spécialisée en finance ou en santé, similarité documentaire et clustering de corpus.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).