voyageai/voyage-law-2
Publié le 15 avril 2024 par Voyage AI, voyageai/voyage-law-2 est un modèle d’embedding spécialisé dans les contenus juridiques. Il produit une représentation dense de 1 024 dimensions, conçue pour rapprocher numériquement des textes selon leur sens.
Publié le 15 avril 2024 par Voyage AI, voyageai/voyage-law-2 est un modèle d’embedding spécialisé dans les contenus juridiques. Il produit une représentation dense de 1 024 dimensions, conçue pour rapprocher numériquement des textes selon leur sens.
Il sert notamment à indexer et retrouver des documents juridiques, à alimenter la recherche d’un système RAG, à mesurer la similarité entre textes ou à regrouper des contenus par proximité. Avec environ deux ans d’ancienneté, il appartient à une génération désormais très ancienne à l’échelle de l’IA et probablement dépassée par des offres plus récentes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 15 avril 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 16 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 78,8 % | 4ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 56,6 % | 23ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Legal | 65,4 % | 3ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 67,5 % | 19ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: RTEB German
Notre analyse
Forces. Les résultats MTEB placent voyageai/voyage-law-2 parmi les meilleurs modèles en recherche juridique, notamment pour retrouver des décisions, des textes de loi et des contenus de questions-réponses. Il se distingue aussi nettement en Long-context Retrieval, ce qui indique une bonne qualité de recherche sur des tâches synthétiques et réelles faisant intervenir des contextes longs. RTEB German montre par ailleurs de solides performances de retrieval en allemand dans plusieurs domaines spécialisés, dont le juridique, la santé et les entreprises. Sa représentation dense de 1 024 dimensions fournit un format vectoriel directement exploitable pour l’indexation, la similarité et le clustering.
Limites et points d’attention. Les résultats RTEB Legal sont comparativement moins dominants que ceux du track MTEB Legal, même si le modèle reste bien classé face à un large ensemble de concurrents. Une dimension de 1 024 implique aussi des index plus volumineux et davantage de calcul lors de la recherche qu’avec des embeddings de dimension inférieure. Son ancienneté d’environ deux ans est très importante dans ce secteur, ce qui rend probable un dépassement par des modèles plus récents et un retrait des catalogues actuels. Usages pertinents : recherche sémantique juridique, RAG documentaire, rapprochement de textes et clustering de corpus spécialisés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).