voyageai/voyage-3
Publié par Voyage AI le 18 septembre 2024, voyageai/voyage-3 est un modèle d’embedding dense qui représente chaque texte par un vecteur de 1 024 dimensions. Il sert à mesurer la proximité sémantique entre des contenus, sans générer de texte.
Publié par Voyage AI le 18 septembre 2024, voyageai/voyage-3 est un modèle d’embedding dense qui représente chaque texte par un vecteur de 1 024 dimensions. Il sert à mesurer la proximité sémantique entre des contenus, sans générer de texte.
Ses vecteurs peuvent alimenter un moteur de recherche sémantique, la récupération documentaire d’un système RAG, le rapprochement de textes similaires ou le clustering de corpus. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe derrière des générations plus récentes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 18 septembre 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 32 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 74,1 % | 9ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 54,3 % | 29ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 61,5 % | 15ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 64,1 % | 5ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 46,0 % | 58ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 65,0 % | 27ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Scandinavian | 58,6 % | 20ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 1,3 % | 28ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: RTEB German
Notre analyse
Forces. Les résultats MTEB placent voyageai/voyage-3 parmi les meilleurs modèles évalués en Long-context Retrieval et en recherche juridique générale. Il apparaît donc particulièrement adapté à la récupération d’informations dans des documents longs, des décisions, des textes législatifs, des questions-réponses juridiques et d’autres corpus spécialisés. Ses performances médicales et allemandes restent également solides, ce qui étend son intérêt aux contenus cliniques, biomédicaux, grand public et à plusieurs domaines professionnels en allemand. La représentation dense de 1 024 dimensions fournit un format vectoriel directement exploitable par les index de similarité.
Limites et points d’attention. Les évaluations Scandinavian et RTEB Legal sont moins favorables que ses meilleurs résultats, avec des positions plus éloignées de la tête du classement. Les performances peuvent donc varier sensiblement selon la langue, le corpus et le protocole de recherche juridique. Chaque passage indexé nécessite par ailleurs le stockage de 1 024 valeurs, un paramètre à intégrer dans le dimensionnement de l’index et des calculs de similarité. Compte tenu de son âge, une comparaison avec des embeddings plus récents est pertinente avant déploiement. Usages pertinents : recherche sémantique, RAG documentaire, similarité et clustering, notamment sur des corpus longs, juridiques ou médicaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).